{"as_of":"2026-08-10T15:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:091ac969bcffe5128a283bd35c69b1f7c79aedb032a40be40b239f9d1c8773d8","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:51:53.074321Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.04509/citation-record","integrity":"/paper/2507.04509/integrity","json":"/paper/2507.04509/citation-record.json","paper":"/paper/2507.04509"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:58.252492Z","title":"Random sample consensus: A paradigm for model fitting with applications to image analysis and automated cartography,","venue":null,"work_id":"eb9177c7-22bf-41c8-aa63-6c98a923d0be","year":1981},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.260692Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:6075eaebab42df3e64b5583551344994c1dd98f1fc5fec8ae8b94e6384a2e18d","observation_id":"638fde49-e415-43b4-bea2-c236ad418035","resolution":{"observed_at":"2026-08-06T19:51:58.329827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:58.110726Z","title":"Posenet: A convolutional network for real-time 6-dof camera relocalization,","venue":null,"work_id":"398ba6b3-c92d-4f17-871c-aca8136f4540","year":2015},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.355729Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:e4f93e996135ef36fdf2e0ae97af4c9511f18350e27f31e36f23f704d49dc15d","observation_id":"362dd15c-f339-4545-95e0-e0491b5f214d","resolution":{"observed_at":"2026-08-06T19:51:58.175786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:58.004322Z","title":"Image-based localization using lstms for structured feature correlation,","venue":null,"work_id":"bfc30eb8-64d9-4881-9ffc-7e35028a5fbb","year":2017},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.425621Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:956c18dc81fe7b6a782798c60f48d6bc713366aa9daa6783e12e486ad4e6289d","observation_id":"6e56b12d-7ddd-47d2-8c99-9342ec23b794","resolution":{"observed_at":"2026-08-06T19:51:58.050472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:57.899347Z","title":"Image-based localization using hourglass networks,","venue":null,"work_id":"b11d2d10-5dcd-4b43-98a9-0640832ee7e6","year":2017},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.505453Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:821e93a6488267eb527ff84f4625a641acf08fe891b5812cd0f3c8ea81a45161","observation_id":"d23f89fb-7306-462d-b63d-0850a8f6cd66","resolution":{"observed_at":"2026-08-06T19:51:57.962733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:57.736682Z","title":"Modelling uncertainty in deep learning for camera relocalization,","venue":null,"work_id":"46208fe5-d956-4266-b7dc-bcfbab5a2d71","year":2016},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.541883Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:a317082aa2521cd723f1d19f5cd6e416237f02bc0df9d6cbc279316210dfbbd4","observation_id":"96a5534c-f03e-4db4-9c85-9049bf354677","resolution":{"observed_at":"2026-08-06T19:51:57.814913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:57.592105Z","title":"Geometric loss functions for camera pose regression with deep learning,","venue":null,"work_id":"a8ffc870-2305-45e2-96c1-4b2d9b8bf963","year":2017},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.649083Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:0000c06a168ecbbf3a8da69d8f1013cafe7e917f1546b7a625f6ff28dbedb376","observation_id":"7d8c9377-86e9-4e77-b200-acd37f6af818","resolution":{"observed_at":"2026-08-06T19:51:57.672985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:57.484580Z","title":"Vidloc: A deep spatio-temporal model for 6-dof video-clip relocalization,","venue":null,"work_id":"091f808b-dda9-4bcf-9a2c-6117c00d553b","year":2017},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.708062Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:6b5f1c6e8c21365604349e0211b08b16942dbec305c0684726889d187eb298ba","observation_id":"f5555b2d-9c3e-4b87-825d-3a101907eee6","resolution":{"observed_at":"2026-08-06T19:51:57.529663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:57.369497Z","title":"Atloc: Attention guided camera localization,","venue":null,"work_id":"ab8a72ec-3c60-4125-a705-2d2bf796a3b4","year":2020},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.797015Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:1a834317ccaa04e0bbbdf75b86cfffbacc40554e7d9b3a76fa68ea641205f0f8","observation_id":"c35f19f2-66a0-4abc-b7f7-82da0b72176c","resolution":{"observed_at":"2026-08-06T19:51:57.416565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:57.222612Z","title":"Effloc: Lightweight vision transformer for effi- cient 6-dof camera relocalization,","venue":null,"work_id":"89178b65-9835-4175-b357-7f75aed90fe1","year":2024},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.878081Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:35de47004a3b299e4c1395ed1c886b304b09035672f8f00382ddc04ee4cdc5f5","observation_id":"91c298e2-af3a-43ba-8ed9-cfd3119541c6","resolution":{"observed_at":"2026-08-06T19:51:57.300384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16986","last_updated":"2023-10-19T17:59:43Z","snapshot_observed_at":"2026-07-06T15:33:57.659685Z","submitted_at":"2023-05-26T14:41:06Z","title":"NavGPT: Explicit Reasoning in Vision-and-Language Navigation with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16986","snapshot_observed_at":"2026-08-06T19:51:50.963143Z","title":"Navgpt: Explicit reasoning in vision-and-language navigation with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:50.963143Z"},"links":{"cited_paper":"/paper/2305.16986","citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:f5def470a30176f17a60ac83fb6888d53212e74edd0192afd5dc5e68c1014bf2","observation_id":"11c3bad6-0b8d-4f07-b6de-e5207a512cf4","resolution":{"observed_at":"2026-08-06T19:51:50.963143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-06T19:51:51.065164Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.065164Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:60e6a384ac6f708a37b2373439d6688cffec9fa940d63a738c18567deaeb50ec","observation_id":"8a0113dc-d0f3-4fa9-97b9-53026008ccf0","resolution":{"observed_at":"2026-08-06T19:51:51.065164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:57.131989Z","title":"Extending absolute pose regression to multiple scenes,","venue":null,"work_id":"c4fc76db-6a9f-4991-bb17-abfce6f3851e","year":2020},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.145193Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:e8cd705d9494b9dd0fc20e453eeae8d492a9270ecb7c6d4efdbf2f1fb0bf05f3","observation_id":"ef2c3e76-431d-4d3d-a9c4-372d8b0ea5f7","resolution":{"observed_at":"2026-08-06T19:51:57.175742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:56.977064Z","title":"Coarse-to-fine multi-scene pose regression with trans- formers,","venue":null,"work_id":"062ea124-2ea1-42b7-8028-528488f09760","year":2023},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.218239Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:d021d6f4fc9cdb782144aba23d3a5eb1df7f371795c1549ff87093cb1fdcd710","observation_id":"3c40f7ac-7a35-4f5d-ba29-539d8f14ddcd","resolution":{"observed_at":"2026-08-06T19:51:57.053636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:56.828117Z","title":"City-scale landmark identification on mobile devices,","venue":null,"work_id":"fdd1d5c6-c5f9-4783-a433-014038cc388e","year":2011},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.307081Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:3a71529ee3c9797b314ad906db41b0c64bfbd0d3d4ad2ccaab88744e716c575c","observation_id":"6df5821e-0bac-4bdf-86b9-8ac1b311214a","resolution":{"observed_at":"2026-08-06T19:51:56.892027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:56.520979Z","title":"Imagdressing-v1: Cus- tomizable virtual dressing,","venue":null,"work_id":"70e424d1-0789-488d-989a-e0e8f625813c","year":2025},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.394012Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:cd152c192397d46b651b2f595daf1e37700ef05dbcd602c3b3315e9af7ac9c35","observation_id":"c13af43b-2b0c-4343-b543-574fb85d132c","resolution":{"observed_at":"2026-08-06T19:51:56.661234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:51.465976Z","title":"Imagpose: A unified conditional framework for pose-guided person generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.465976Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:fae9187e69ba767664bfb6d80ff6cc23874fd3fdd09e5b3e4d4c089d0e035bcd","observation_id":"3243608f-e3ab-4310-9934-8b36b0961e8b","resolution":{"observed_at":"2026-08-06T19:51:51.465976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:56.234671Z","title":"Dsac-differentiable ransac for camera localization,","venue":null,"work_id":"5c2ebe1d-f1b6-4482-9ff4-78094bba01ab","year":2017},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.567426Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:7976bed0bd8d80704d791d6f9c9ec38430b95046aa185fe17791a0825e1516e1","observation_id":"28313878-7355-4dd8-88e7-2d146d3d4dd9","resolution":{"observed_at":"2026-08-06T19:51:56.366071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:55.994916Z","title":"Hybrid scene compression for visual localization,","venue":null,"work_id":"0985c31a-2f12-4445-8b55-7f5545249c65","year":2019},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.604086Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:f3285ade14f25e01441b5f3bb5d0f9001678df687fe16e7f05faaa74daf988d5","observation_id":"eaf78365-3f39-4339-94d2-fb681fe3373e","resolution":{"observed_at":"2026-08-06T19:51:56.099167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:55.808427Z","title":"Map-free visual relocalization: Metric pose relative to a single image,","venue":null,"work_id":"0ea20fec-8ca7-47da-8f7a-795bb4d766aa","year":2022},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.641587Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:1eaa1261751d6cc3aaec1a567b0c8e047174f24b73aed0c0e7f3a1db4a28b617","observation_id":"c0b92286-dabf-42d7-a745-590ecbcb0bc2","resolution":{"observed_at":"2026-08-06T19:51:55.912782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:55.693430Z","title":"Learning multi-scene absolute pose regression with transformers,","venue":null,"work_id":"a199626d-64a5-414b-af65-5d1ce950004f","year":2021},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.742970Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:511f85e6163cc32129fc3181e6229f1a77a42b8a873998eb71247674da7bf06a","observation_id":"cec9be87-48db-4302-8628-d1ced13e8a31","resolution":{"observed_at":"2026-08-06T19:51:55.740171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:55.547036Z","title":"Geometry-aware learning of maps for camera localization,","venue":null,"work_id":"d232bd3b-04f8-48e6-9442-adfb1dc9049f","year":2018},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.798687Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:1582842fed6600e0e942e8d65178c62da45a4907185f0df61298abeab38bd085","observation_id":"cc0e3ccf-ea5f-405f-b71a-94df2dabad27","resolution":{"observed_at":"2026-08-06T19:51:55.618580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:55.336885Z","title":"Fusionloc: Camera-2d lidar fusion using multi-head self-attention for end-to-end serving robot relocalization,","venue":null,"work_id":"c659e805-fff2-495f-be93-6c501bf1f6f2","year":2023},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.894716Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:4b2ce80eafa6c2fb041b965eec6ee0e70997115ab5f0afd3d3bb5a48d7225b65","observation_id":"c44a2cfe-b1cc-4474-941d-dcaf2fd101b9","resolution":{"observed_at":"2026-08-06T19:51:55.452563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:55.187158Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"11edd8df-cb54-4247-9f47-29f4746db9ae","year":2021},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:51.949874Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:7a2cde5b26efe60f779ab24c7fefc62a1ad448cc05ca97797c0ac4e1dfc39593","observation_id":"75f786dc-6c23-417d-8104-ed146e475ff7","resolution":{"observed_at":"2026-08-06T19:51:55.249451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-09T19:43:52.666104Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-08-06T19:51:52.021631Z","title":"Clip-adapter: Better vision-language models with feature adapters,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.021631Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:07548571e0295d6ed168c092c02f5ccb5738acef9a967d98cb5c25990212eea8","observation_id":"7b745bcb-5c88-475d-b6fc-c15536b35469","resolution":{"observed_at":"2026-08-06T19:51:52.021631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:55.024260Z","title":"Envedit: Environment editing for vision-and-language naviga- tion,","venue":null,"work_id":"dedc0d18-0b87-4423-92b1-873bb86005e1","year":2022},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.093706Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:e3a1de2bb12e65b72a6d00cbe8f64e453afbd1bed02e0b5c0b74d4d98977072a","observation_id":"e814071b-bf23-4026-8066-692a376fc4c7","resolution":{"observed_at":"2026-08-06T19:51:55.073543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:54.914171Z","title":"Learning to generate scene graph from natural language supervision,","venue":null,"work_id":"4a70ab9e-cf78-4920-8267-28fd2a4c11f4","year":2021},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.204735Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:7ca05b2096d37e4954c8bfd9be0b9a367b931d145142bf9f570018456b790840","observation_id":"eb68e5e1-1336-4a25-be70-1f42839c86d7","resolution":{"observed_at":"2026-08-06T19:51:54.966464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:54.796869Z","title":"Denseclip: Language-guided dense prediction with context-aware prompting,","venue":null,"work_id":"ecbd7be4-f7e9-410b-ba55-df5b612944d7","year":2022},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.282022Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:3798e9d6dbc23b5a9591a9a9857e5b8d3f1f9c335aff69cbbbf2836bc81b399e","observation_id":"c666e258-ce83-4cdc-87b0-d6f1eb17bad3","resolution":{"observed_at":"2026-08-06T19:51:54.855050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:54.605881Z","title":"Fm-loc: Using foundation models for improved vision-based localization,","venue":null,"work_id":"8353d33a-32f1-42ba-b03e-d2fa407e3aea","year":2023},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.397707Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:116f48cb86fc4b11e39c5c27435fea449bff9c01cbd371df1ed02dad57f969bb","observation_id":"9afee136-979f-4461-ad99-dda00c0805d6","resolution":{"observed_at":"2026-08-06T19:51:54.708146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:54.427235Z","title":"Clip-loc: Multi-modal landmark association for global localization in object-based maps,","venue":null,"work_id":"73a6b17f-cb76-4b88-b335-b13cd1903bb3","year":2024},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.488586Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:019278e377189d9736fcc1fa4bca4fabfac457e93332a23d48c346ee43850e31","observation_id":"b37d3e6a-e5fd-4118-b89b-61be37dd36e0","resolution":{"observed_at":"2026-08-06T19:51:54.488600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:54.225486Z","title":"Geollm: Extracting geospatial knowledge from large language models,","venue":null,"work_id":"0559af1f-376e-4503-b588-fbb7a5f1ab79","year":2024},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.561556Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:8f3a32948f3ce26e8207d944380d707779ab305acb1aac8f056e67175135edd9","observation_id":"f1622f84-0953-49c4-8d5a-4610bba884a6","resolution":{"observed_at":"2026-08-06T19:51:54.312406Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:54.010350Z","title":"Georeasoner: Geo-localization with reasoning in street views using a large vision-language model,","venue":null,"work_id":"250cf89d-cca3-4289-a1f7-f74032bd8767","year":2024},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.660280Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:6d0a109a25affcb4832ea58892a81e23c81e21927254d984b0b586ea310cc5a6","observation_id":"40438513-e33f-406f-9f44-371719b0664f","resolution":{"observed_at":"2026-08-06T19:51:54.112020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06313","last_updated":"2024-11-21T12:06:59Z","snapshot_observed_at":"2026-08-10T12:41:22.162322Z","submitted_at":"2023-10-10T05:13:17Z","title":"Advancing Pose-Guided Image Synthesis with Progressive Conditional Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06313","snapshot_observed_at":"2026-08-06T19:51:52.756841Z","title":"Advancing pose-guided image synthesis with progressive conditional diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.756841Z"},"links":{"cited_paper":"/paper/2310.06313","citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:5e6e58181c3e97dfaab8b729e87e5d5db5547fb482ac9493e7e1ac04c2819c5a","observation_id":"914a639e-3631-4c88-8f43-7a73f31c2c34","resolution":{"observed_at":"2026-08-06T19:51:52.756841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:53.815931Z","title":"Boosting consistency in story visualization with rich-contextual conditional diffusion models,","venue":null,"work_id":"35369030-3242-4e95-9aef-701512c157fa","year":2025},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.847978Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:c99a4669a2e65590debcac90dabe8d58402c342c14632612b1dc3356cd9aab4c","observation_id":"64f9f7c1-362b-477c-a6a6-2db52a0c705f","resolution":{"observed_at":"2026-08-06T19:51:53.933474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:53.637608Z","title":"7-scenes dataset,","venue":null,"work_id":"5f468b4a-29be-4c83-9868-d86b6a069d1e","year":2013},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:52.928410Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:4ae2c26123a4134efb1df43133fe3b7d391faf7c84cbd861c46765829162b485","observation_id":"2e3092c5-4a38-4a7d-a651-017588757960","resolution":{"observed_at":"2026-08-06T19:51:53.706874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:53.454335Z","title":"Do we really need scene-specific pose encoders?","venue":null,"work_id":"b4c8fb15-2c2d-4783-af72-584879aa5e36","year":2021},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:53.005097Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:29518cf43259d6f045dbad5d55b67787109c6917e3f12f87e91e3ef3a108a0b7","observation_id":"cbb96d11-fce4-4cb5-9e62-0dc5cccb8b9c","resolution":{"observed_at":"2026-08-06T19:51:53.521611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:51:53.264289Z","title":"Image-based localization using hourglass networks,","venue":null,"work_id":"22f316e7-e492-4bab-ab7c-7bc6acec878e","year":2017},"citing_paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:51:53.074321Z"},"links":{"citing_paper":"/paper/2507.04509"},"observation_digest":"sha256:b6b6192c7be226f4096ba6c7d75232c616bee1148480b227b46ca45d4b7455a7","observation_id":"d4c93214-bca1-4038-99db-956f9694ab88","resolution":{"observed_at":"2026-08-06T19:51:53.328502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04509","last_updated":"2025-07-06T18:52:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:08:38.610344Z","submitted_at":"2025-07-06T18:52:16Z","title":"MVL-Loc: Leveraging Vision-Language Model for Generalizable Multi-Scene Camera Relocalization"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":31},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2507.04509."}