{"as_of":"2026-08-10T08:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f4b79008e5896acd0ad12d9adee67c739c8f0492d27f3384b7e75fbe80f38f92","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:39:29.580035Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T14:24:49.968980Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.10318","snapshot_observed_at":"2026-08-03T14:24:49.968980Z","title":"Mind the gap: Aligning vision foundation models to image feature match- ing.arXiv preprint arXiv:2507.10318, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.20606","last_updated":"2026-06-29T06:12:05Z","snapshot_observed_at":"2026-08-10T03:49:39.462963Z","submitted_at":"2025-12-23T18:54:10Z","title":"Probing and Leveraging Video Diffusion Transformer Features for Robust Point Tracking","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T14:24:49.968980Z"},"links":{"cited_paper":"/paper/2507.10318","citing_paper":"/paper/2512.20606"},"observation_digest":"sha256:3485cf3b16123c66099e3dfb59c529006ffb3d7afa8b25f0e00a8e328d144599","observation_id":"5470f779-d45d-474b-a5cd-7888123a85c0","resolution":{"observed_at":"2026-08-03T14:24:49.968980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.10318/citation-record","integrity":"/paper/2507.10318/integrity","json":"/paper/2507.10318/citation-record.json","paper":"/paper/2507.10318"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:37.853466Z","title":"Burst: A benchmark for unifying object recognition, segmentation and tracking in video","venue":null,"work_id":"77134c89-b4cf-4a00-a5b5-a966d69c85ca","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.108553Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:ed9c58ab0ce0d63e93599666d1285328da2f7cc58320d79175969ebdf10ad248","observation_id":"4bc141d3-7675-4a91-93f2-d87a7f3465e5","resolution":{"observed_at":"2026-08-06T17:39:37.856565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:37.842475Z","title":"Hpatches: A benchmark and evaluation of handcrafted and learned local descriptors","venue":null,"work_id":"7b891d36-6b6c-4a6b-88ba-39d9434210d7","year":2017},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.201361Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:b6a01dfb98fd8665aa27744813d305c309852e21713304d55ac2b6225913982d","observation_id":"756c8d63-ff4b-467d-9dd6-15e914fccb81","resolution":{"observed_at":"2026-08-06T17:39:37.846283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:37.660473Z","title":null,"venue":null,"work_id":"7f8270c2-434f-4bcc-a521-faba52976e09","year":2019},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.298170Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:254d5daef16e411bcd2e48a09e10c068e3fe4ab5035c06b17a31594a4a38c265","observation_id":"24de8596-906f-4ce2-bd45-d38b533b1ad8","resolution":{"observed_at":"2026-08-06T17:39:37.778915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:25.377933Z","title":"Surf: Speeded up robust features","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.377933Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:84671d847754c638c2647c4e3a9938aeed92055b40e4c64883db8cab4ec640be","observation_id":"a2ca3393-b810-4c80-97cd-4e163f48e6bc","resolution":{"observed_at":"2026-08-06T17:39:25.377933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:37.469517Z","title":"Speeded-up robust features (surf)","venue":null,"work_id":"fe748802-31ac-4ccf-9d5b-b9714c6786e2","year":2008},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.474100Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:15f2ec03deab8beb102111f4f3cb4d80cdf85a07b0412ca4982d50d18807506e","observation_id":"904d3fe5-893a-4e2d-bcfd-ce89a4d86e40","resolution":{"observed_at":"2026-08-06T17:39:37.567856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15961","last_updated":"2024-02-25T02:51:44Z","snapshot_observed_at":"2026-08-09T10:52:52.923414Z","submitted_at":"2024-02-25T02:51:44Z","title":"VOLoc: Visual Place Recognition by Querying Compressed Lidar Map","version":1},"cited_work":{"arxiv_id":"2402.15961","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.15961","snapshot_observed_at":"2026-08-06T17:39:29.908110Z","title":"VOLoc: Visual Place Recognition by Querying Compressed Lidar Map","venue":"cs.CV","work_id":"4203b644-d310-4a94-a270-995b47788e5a","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.536456Z"},"links":{"cited_paper":"/paper/2402.15961","citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:6e7ae8b327e5758e9ef5cc347fbdd381b7b6b19f5dcbf04f1fe49a025bf039a7","observation_id":"84983732-8d76-4fd7-a9e9-a9d50bf1c739","resolution":{"observed_at":"2026-08-06T17:39:29.984495Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:37.226541Z","title":"Prism: Pro- gressive dependency maximization for scale-invariant image matching","venue":null,"work_id":"50bb0b06-504a-4001-b175-e71bc1c30f65","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.625802Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:2d815b088aa68629bdb8b50a09017b177b3d51cbb96419c233c6f4dd90f20197","observation_id":"dc0dafdf-0a80-4042-9b63-3a67dac07e34","resolution":{"observed_at":"2026-08-06T17:39:37.392675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:37.070534Z","title":"Improving transformer-based image matching by cascaded capturing spatially informative keypoints","venue":null,"work_id":"04e2410d-0d66-453b-9c9e-dca0c183f993","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.728919Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:60ddcd65c5133665c2c1bfaaf9fde6e59a0e0fe4162a96b50a3596ae3c74493c","observation_id":"d33e7e9d-8a53-48c3-ab78-6d6a09fea765","resolution":{"observed_at":"2026-08-06T17:39:37.154073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:36.906621Z","title":"Aspanformer: Detector-free image matching with adaptive span transformer","venue":null,"work_id":"33c6a248-3762-49bd-a3a9-0baa5eb31d17","year":2022},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.775270Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:c3c65ab522ba9b4f84a0b994a1d3e10ca402698c4934df5b91841e075fefb250","observation_id":"35df9448-77ba-495d-8ec8-2a9c4003d9dc","resolution":{"observed_at":"2026-08-06T17:39:36.959512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:36.667213Z","title":"Ecomatcher: Efficient clustering oriented matcher for detector-free image matching","venue":null,"work_id":"77900c6a-54c8-405f-93af-2d0c23b332ab","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.817823Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:cf53873d525ee641005cc646c72db79ddb8e4cca3381296fe63d88388116ad5e","observation_id":"e43532a9-5957-4d6b-b6bf-ca6b5f0704d0","resolution":{"observed_at":"2026-08-06T17:39:36.754168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:36.481439Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":"b16147fc-09ac-40ba-a84e-229c0eccacf0","year":2017},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.855956Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:befebb1ea6c72639f7f4d772e12b3c38b3b233f552a9c7b4e0aaf727b704d376","observation_id":"a9318b76-92f6-4235-9996-27774f6251cc","resolution":{"observed_at":"2026-08-06T17:39:36.560632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:36.281517Z","title":"Superpoint: Self-supervised interest point detection and description","venue":null,"work_id":"0d560bb7-58e7-4cf7-bb13-d12faa34f700","year":2018},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.919632Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:dbd6e8ae14eff1e0be7c05b1c66783c949094977e616cd71932baea63fb09e6d","observation_id":"070a27cd-51d9-4b48-b33c-3588af7b8a5c","resolution":{"observed_at":"2026-08-06T17:39:36.378666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:36.181353Z","title":"Diffusion models beat gans on image synthesis","venue":null,"work_id":"9c1f039d-de84-4a39-a6f7-743a9f4cd40f","year":2021},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:25.983654Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:ec2e92e3df0ec2dee4b929e53324a5cd050c969f5ca2f578d14818d91cde405f","observation_id":"1c8f08ac-794d-40a3-8521-6addefadc609","resolution":{"observed_at":"2026-08-06T17:39:36.200418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:36.041999Z","title":"Dkm: Dense kernelized feature matching for geometry estimation","venue":null,"work_id":"30df775e-fc73-40e5-abd3-bf117c883b7d","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.075536Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:d70224e414b14513cf8cd2cbe33b4949a4024fb11822f7cc534f725f6c260abe","observation_id":"da261533-5483-4852-8b58-cb367799727c","resolution":{"observed_at":"2026-08-06T17:39:36.103809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:35.879808Z","title":"Roma: Robust dense fea- ture matching","venue":null,"work_id":"035a8813-365a-4826-8e28-9ede3ff34b3c","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.145757Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:ac8c9eb7ad52af5a04cbb3d87257bb74d406279efae6f0332f2941b5bc2d5af5","observation_id":"a12f004c-20c9-4518-b327-c2b995336d2b","resolution":{"observed_at":"2026-08-06T17:39:35.972971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:35.773254Z","title":"Top- icfm: Robust and interpretable topic-assisted feature match- ing","venue":null,"work_id":"496e140b-558c-4ec3-a1a2-fc827cc3ce25","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.220843Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:d86d982921d389a49c4d908f100d5aa91b32399d46c20dbbec56c3f1201be59c","observation_id":"bbe42dae-55cc-4b36-9f7c-861494824c09","resolution":{"observed_at":"2026-08-06T17:39:35.824253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:26.290930Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.290930Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:d70054aecd889756b605ea88a0b241a86319099028161e50317aa68a1ba21154","observation_id":"4548f61f-6638-4d1e-b0b5-b6cc1fe6d4f7","resolution":{"observed_at":"2026-08-06T17:39:26.290930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:35.579920Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"89249d34-24aa-4cc3-a08e-ce42e5c1eb21","year":2022},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.392578Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:d0a8c8d2380c3c4fde8f7d82592f350dd004e9f170061c1b882e33d6fdba291a","observation_id":"d3577e46-a4a3-4ed2-9e62-011b3aa12c3c","resolution":{"observed_at":"2026-08-06T17:39:35.675513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:35.390869Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":"dcd21134-1288-42f2-8dec-a2ccdd7235d6","year":2020},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.469629Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:cbfb64583e5a75b3f43bcfd6918a36085b91482c97ef4a4fa34c873d186621d3","observation_id":"e8c594b2-c443-471c-a17e-5569b80f6f26","resolution":{"observed_at":"2026-08-06T17:39:35.517902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:35.220037Z","title":"Dynamicid: Zero-shot multi-id image personalization with flexible facial editabil- ity","venue":null,"work_id":"0aca7109-04d7-4ef2-a683-d34b7f13c799","year":2025},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.535857Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:1e9451e842856aff83a13015a0756febd3bc84d17c3d2017f8458166e0a3ebb6","observation_id":"4c876dab-15d7-424d-a0be-6d4397234437","resolution":{"observed_at":"2026-08-06T17:39:35.300228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:35.068010Z","title":"Omniglue: Generalizable feature match- ing with foundation model guidance","venue":null,"work_id":"34e1c192-9505-4ee1-9596-bf6f81671fd2","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.616999Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:892db62ddbc10eda2250aad8e71bc5a702572fa014eb7a5abd083807af4428b6","observation_id":"c7ec0d92-1951-4c36-a0cf-b39b8651e222","resolution":{"observed_at":"2026-08-06T17:39:35.162338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:26.711760Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.711760Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:364a69f382a94ec9226eee727d5846882bdf738a8b599b00686420db471dd4eb","observation_id":"55c6ccaf-9893-4b15-a619-1b6ce19ca8e3","resolution":{"observed_at":"2026-08-06T17:39:26.711760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:34.916468Z","title":"Sd4match: Learning to prompt stable diffu- sion model for semantic matching","venue":null,"work_id":"7ad82336-1100-4636-8359-c98f9179b4ad","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.781562Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:c77ca2aee970bce7efb8a92e9df801e2315df40d1ede1c7d0e5d58564d9ff99c","observation_id":"a95c3a97-891d-4892-8be2-85a0a65f7c1a","resolution":{"observed_at":"2026-08-06T17:39:35.017486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:34.755602Z","title":"Megadepth: Learning single- view depth prediction from internet photos","venue":null,"work_id":"a3776dbe-3717-49ab-97bf-769d630a06ee","year":2018},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.854437Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:f62f4896c012adb9429defab27c7c91d2b9bdae077f660a6733a59201b0e6922","observation_id":"03a73a54-fa32-40d8-9682-852623082ad7","resolution":{"observed_at":"2026-08-06T17:39:34.858580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:34.624560Z","title":"Recrecnet: Rectangling rectified wide-angle images by thin-plate spline model and dof-based curriculum learn- ing","venue":null,"work_id":"77fa4a2d-2a15-4b6e-9e68-cc6a78159a51","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:26.915593Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:bb5e07209e61c2e55f10294de1684eb7b8ac5068d50afea6a57e04be8f968d73","observation_id":"b140ce15-c14e-40e1-8239-8b8992a360dc","resolution":{"observed_at":"2026-08-06T17:39:34.697273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:34.490539Z","title":"Feature pyra- mid networks for object detection","venue":null,"work_id":"dafe7395-21c9-48d8-b595-08a548a97eb0","year":2017},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.008107Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:a266ceba30e4eef4fec662d5eb1f3370c4c18e2303c7fed41e8bca46dd16bf09","observation_id":"cbb360a1-5166-40d3-a3a8-e95e79844a2e","resolution":{"observed_at":"2026-08-06T17:39:34.562423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:34.379665Z","title":"Lightglue: Local feature matching at light speed","venue":null,"work_id":"94eab665-4070-4d96-8188-54cb550f4f66","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.078922Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:875de56e6acf296427b35b7dd7c4133804b387d8944de2f6627ac38a479af7d8","observation_id":"0e3b00dc-2f28-4bae-a4df-b1f79a9861ef","resolution":{"observed_at":"2026-08-06T17:39:34.421039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:34.247261Z","title":"Semantic- aware representation learning for homography estimation","venue":null,"work_id":"b36a5949-80e3-4eee-b98d-a0d5b3caadec","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.136387Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:09dcbfaac1da29c26453d5f0f0ac8d6d8c9ed9a6a6ca5120aacf3e7d4597f96c","observation_id":"a27d2dc7-f8b6-49cf-8f23-14d8b8dfff31","resolution":{"observed_at":"2026-08-06T17:39:34.293249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:27.196330Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.196330Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:1aeb882b52c3df7a0836d7d4e0c723f20e163f412086d78e9891085e1275b4d8","observation_id":"67a59f89-9e45-488f-9897-935d63b327c4","resolution":{"observed_at":"2026-08-06T17:39:27.196330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:34.102034Z","title":"Distinctive image features from scale- invariant keypoints","venue":null,"work_id":"d4d17653-655b-4b48-b4b8-12c6ba31e8d9","year":2004},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.266560Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:cde222cfde6b23bda90e4c50873f734aba1242a61f483ea552abac569b13dd2f","observation_id":"94568ca6-1309-498e-97d4-f7b6be224f49","resolution":{"observed_at":"2026-08-06T17:39:34.172494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:33.955295Z","title":"Raising the ceiling: Conflict- free local feature matching with dynamic view switching","venue":null,"work_id":"c3544056-53bf-40ab-ba64-ddea12b8b2e3","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.308887Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:3bbe1efb190609188fa0f60e5d911ba0d0c451e6ff5d7705a9907711f2240b6d","observation_id":"ff7ace8f-0a0d-4e7d-925c-e4841cde794e","resolution":{"observed_at":"2026-08-06T17:39:34.031882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19094","last_updated":"2024-01-25T07:10:41Z","snapshot_observed_at":"2026-07-06T15:35:26.335169Z","submitted_at":"2023-05-30T14:58:24Z","title":"Diffusion Model for Dense Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19094","snapshot_observed_at":"2026-08-06T17:39:27.364440Z","title":"Diffusion model for dense matching.arXiv preprint arXiv:2305.19094,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.364440Z"},"links":{"cited_paper":"/paper/2305.19094","citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:6113c5221108400330d837a744ec49081795439fccea947e348d1bda2a7f28a9","observation_id":"0a3cc0d3-66f8-4460-b93e-cca54871611e","resolution":{"observed_at":"2026-08-06T17:39:27.364440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:33.811966Z","title":"Unsupervised deep image stitching: Reconstructing stitched features to images","venue":null,"work_id":"8db649a9-714b-45fc-a454-9c2cfa4378db","year":2021},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.422565Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:96e022022c688e02a2f5b5d6e6c461d5aa8d6dd051f1ecb0dec15b9ad43c2839","observation_id":"366924d7-07d4-4d99-b556-10c53e212838","resolution":{"observed_at":"2026-08-06T17:39:33.884826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T17:39:27.473301Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.473301Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:0ee3160090edd471820cbf782b0919c1e3ffb32c924456db009c8f3faec1f30f","observation_id":"6e3d36ea-47ca-45b8-ab3f-75e0e8c32329","resolution":{"observed_at":"2026-08-06T17:39:27.473301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:33.694308Z","title":"Enhancing deformable local features by jointly learning to detect and describe keypoints","venue":null,"work_id":"7d4e5665-3592-4753-a0a6-a6dfada25ecd","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.541307Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:cfb4681a0036bed7753cede7d95449e67d7c7b727815de0ad1cbb79115572489","observation_id":"fd2881af-efa5-4df9-9ad6-c19daaa7db92","resolution":{"observed_at":"2026-08-06T17:39:33.747990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:33.518838Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"40be51bb-a933-41d2-93e7-fe2ea5c133af","year":2021},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.599471Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:c8293c78ebdfb7bbd3cd3cc2dc89e645f44cbbb0f98d8ed3aa65fbab86218619","observation_id":"5a3f4967-3b91-4f78-9039-865fce183440","resolution":{"observed_at":"2026-08-06T17:39:33.625802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:33.370913Z","title":"R2d2: Reliable and repeatable detec- tor and descriptor","venue":null,"work_id":"05e14dd0-d77a-4189-80a5-4a14e1d3405d","year":2019},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.655373Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:14ca91eab02e41e45dfffadd45f9fdd78fd258772f93733b1d1b52305c941082","observation_id":"70bc9d2e-73e1-4040-8a00-03d86913dc32","resolution":{"observed_at":"2026-08-06T17:39:33.457903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:33.109987Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"b024a937-1df8-42c4-9ffd-a4e64edd24ec","year":2022},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.718222Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:fe06db8542edbeabe7bba5fe5a9030f54b1e7891f5177f1bf45b2649c9575265","observation_id":"b21463f9-122c-4b08-bc1a-cb102224dff0","resolution":{"observed_at":"2026-08-06T17:39:33.226013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:27.778044Z","title":"Orb: An efficient alternative to sift or surf","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.778044Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:4b4dc21816539fc4348a48bd8707507ae89d9618a65347baf1ad2a0962cc09a2","observation_id":"2348e819-b850-451f-aec9-b22fe4533446","resolution":{"observed_at":"2026-08-06T17:39:27.778044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:32.838570Z","title":"Where’s waldo: Diffusion features for person- alized segmentation and retrieval","venue":null,"work_id":"6b829b15-5554-48d3-adee-014027f643c1","year":null},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.842497Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:00b380723ef9532a6a084f1e7db7009b165b84d11dacf796b4ef58c5793fec6b","observation_id":"4a3840b2-ea6d-49a1-a160-26f54d845d5e","resolution":{"observed_at":"2026-08-06T17:39:32.994498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:32.544790Z","title":"From coarse to fine: Robust hierarchical localization at large scale","venue":null,"work_id":"7f1872a7-5a0a-4841-b48f-2b989e6dc487","year":2019},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.888299Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:d196af5df7cc3ac87b7b5233a39395e697a8801f415c224b44ef7827bf1bbd17","observation_id":"d522f11c-1717-4367-bed7-b0e5294addd8","resolution":{"observed_at":"2026-08-06T17:39:32.663381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:32.363593Z","title":"Superglue: Learning feature matching with graph neural networks","venue":null,"work_id":"1beab6a7-b067-4d32-95fe-3b187c8808dd","year":2020},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:27.953760Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:a88bb21c5ad7cdce1fe7fa38ecf72cb81851f84377739d8323590bb69a27dfcb","observation_id":"00c9f4eb-a961-45e8-ae7f-d6025a30d812","resolution":{"observed_at":"2026-08-06T17:39:32.425716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:32.212387Z","title":"Back to the feature: Learning robust camera localization from pixels to pose","venue":null,"work_id":"b68278cd-919a-4614-bc21-a704d90be651","year":2021},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.004243Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:d1d0e235a0c8364e48794d399b3e57f2ee2b771358f50b594e7e36f8db555409","observation_id":"cba10385-a76f-4133-b112-10efd16b501d","resolution":{"observed_at":"2026-08-06T17:39:32.291176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:32.092815Z","title":"Benchmarking 6dof outdoor visual localization in changing conditions","venue":null,"work_id":"4568d3df-385d-4fc0-9a4d-ba9260a49edf","year":2018},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.063872Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:b5f42f451b8309371a708e48a21850baf3057baa3f02d99cde9f88aafd6bbe04","observation_id":"2d36e1a3-6cb1-4a23-96c6-3b81badb7119","resolution":{"observed_at":"2026-08-06T17:39:32.147368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:31.945361Z","title":"Structure- from-motion revisited","venue":null,"work_id":"0861c79d-7df0-4ddf-a869-8b4a3db3c1d7","year":2016},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.163328Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:4cf392eed0108d5e2f5e469b71265dc797e860866dc045a984099f820bab59f1","observation_id":"fdf1efb3-359f-48af-8a60-1ab49c542121","resolution":{"observed_at":"2026-08-06T17:39:32.002162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:28.275287Z","title":"Pixelwise view selection for unstructured multi-view stereo","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.275287Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:cec6e544558c7066db2e1e5d52c714d9d4821a11a7c0e16f0fc6ca5b68a226fc","observation_id":"df2232f0-de18-4a57-9fc8-bda30024a113","resolution":{"observed_at":"2026-08-06T17:39:28.275287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:31.768186Z","title":"Laion-5b: An open large-scale dataset for training 10 next generation image-text models","venue":null,"work_id":"225186f7-1cf9-445e-97eb-2e636f9eab95","year":2022},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.359469Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:448aabaff47eefbb9d6684448d6fc0063c1b3130bb9eb57244ebe3601b8fe880","observation_id":"427d96aa-3386-4763-91d0-d57e5adc142b","resolution":{"observed_at":"2026-08-06T17:39:31.869337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T17:39:28.447431Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.447431Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:658f99dc1286d6bfd974a779db810683be8c788383a05fc470eb8e370fd8affa","observation_id":"74b1138f-c65a-4a4d-bf43-563ca1732b1a","resolution":{"observed_at":"2026-08-06T17:39:28.447431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:31.648967Z","title":"Loftr: Detector-free local feature matching with transformers","venue":null,"work_id":"7c925216-4647-4452-bfed-a24dfa7013f7","year":2021},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.520920Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:044e4e232bdde78088fe173c2c62abc6435c52bfee47d75de397983d9f61ac6b","observation_id":"0767a589-9a9d-4861-8944-d19cbe56baec","resolution":{"observed_at":"2026-08-06T17:39:31.711218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:31.516395Z","title":"Inloc: Indoor visual localization with dense matching and view synthesis","venue":null,"work_id":"5f03e7d5-8076-4c72-a0ca-858d433afd85","year":2018},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.614403Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:80f7b6d68b2bf74bf74d8f2c86e2c8bf465a775523f14610f02da9d417589dac","observation_id":"dc90f8ae-589d-4c75-8125-0eea407c6c5b","resolution":{"observed_at":"2026-08-06T17:39:31.577976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:31.368442Z","title":"Emergent correspondence from image diffusion","venue":null,"work_id":"92ef1069-4db6-4d7d-a847-5153a76ea8a6","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.704467Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:281b949fb5f1dfd90496b7e041d9b688b2ea2cb6eb233b5f8f1f7ba724e4f967","observation_id":"f85b2797-b92d-41d2-a5ad-ddb97e4c6582","resolution":{"observed_at":"2026-08-06T17:39:31.429567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.02767","last_updated":"2022-03-23T19:10:58Z","snapshot_observed_at":"2026-08-09T10:52:21.435615Z","submitted_at":"2022-01-08T05:45:32Z","title":"QuadTree Attention for Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.02767","snapshot_observed_at":"2026-08-06T17:39:28.721662Z","title":"Quadtree attention for vision transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.721662Z"},"links":{"cited_paper":"/paper/2201.02767","citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:a48449a08ff8b770979300f0dcf97d456abe4c4363194114ca9f832ddecc4b24","observation_id":"0d1b7fd6-57a2-4cb9-b2ef-591173c50acf","resolution":{"observed_at":"2026-08-06T17:39:28.721662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06700","last_updated":"2024-11-11T04:05:12Z","snapshot_observed_at":"2026-07-06T19:48:15.021550Z","submitted_at":"2024-11-11T04:05:12Z","title":"HomoMatcher: Dense Feature Matching Results with Semi-Dense Efficiency by Homography Estimation","version":1},"cited_work":{"arxiv_id":"2411.06700","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.06700","snapshot_observed_at":"2026-08-06T17:39:29.710903Z","title":"HomoMatcher: Dense Feature Matching Results with Semi-Dense Efficiency by Homography Estimation","venue":"cs.CV","work_id":"dcfbfbae-d9c2-409f-9145-9063020f72ad","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.725362Z"},"links":{"cited_paper":"/paper/2411.06700","citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:dbb7d0818d16a18bf5ac40bf4b5b201d257ac869effb781bfe60b876a72540c4","observation_id":"61b4e027-6585-49a9-9d8a-0b944f0982ea","resolution":{"observed_at":"2026-08-06T17:39:29.795682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:31.235691Z","title":"Efficient loftr: Semi-dense local feature matching with sparse-like speed","venue":null,"work_id":"dc27f89a-5548-42cd-bd38-6482bbd7d671","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.728936Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:1fdfa62a221bcf4f9867dca3b297434c233f5f931a7a4548ec92081f404f86c3","observation_id":"462b7df8-e90a-4399-b2c3-2587db946e2c","resolution":{"observed_at":"2026-08-06T17:39:31.294865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:31.068396Z","title":"Croco: Self-supervised pre-training for 3d vision tasks by cross-view completion","venue":null,"work_id":"54d55bf7-25ba-4637-b699-8b66e5c27c31","year":2022},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.829196Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:cd506237175a003302dcbc90c6cdaba0c94f809ed010b1b417ffed6b6631f7eb","observation_id":"f616e622-d0f0-4e29-bd54-aa0f2a3de402","resolution":{"observed_at":"2026-08-06T17:39:31.149646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:28.904750Z","title":"Croco v2: Improved cross-view completion pre- training for stereo matching and optical flow","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.904750Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:e43eb5c77190c54b4f878c7b707a8a27d4e0247f1dddeb8ac61d8859bdc1eb23","observation_id":"09b711a5-6c11-4a40-80b8-44f20bb91b39","resolution":{"observed_at":"2026-08-06T17:39:28.904750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:30.923168Z","title":"Open-vocabulary panop- tic segmentation with text-to-image diffusion models","venue":null,"work_id":"3523009e-e894-48fa-9382-9cf1a5ea6df9","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:28.981804Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:9b5d4a41c7442f5efa12be4f7f15765cc77a44f06f8739875ecf7adc5dc63b09","observation_id":"bf421cb8-49cc-49ee-a1c1-76e69ab1ef8b","resolution":{"observed_at":"2026-08-06T17:39:30.981161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:30.791945Z","title":"Telling left from right: Identifying geometry-aware semantic corre- spondence","venue":null,"work_id":"bdf953b9-bed3-44b4-92f6-2dbc79374712","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:29.111538Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:d0333d71dd6e8c219e2196793afbc66608721cc35ef78ba4dfed3b27097d4799","observation_id":"26a49359-f5fb-41d4-9b9e-09785c3cabae","resolution":{"observed_at":"2026-08-06T17:39:30.843729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:30.652040Z","title":"A tale of two features: Stable diffusion complements dino for zero-shot semantic correspondence","venue":null,"work_id":"054273dd-6639-44a3-96fc-3ce8b03ea2dc","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:29.252854Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:70b850dce6bbbcbc40e99fe2aa0a139fee92d1f95f61025c87f79373254111a5","observation_id":"4e6a71ee-c64b-4a4b-b7ff-298e4763f738","resolution":{"observed_at":"2026-08-06T17:39:30.731910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:30.501051Z","title":"Diffglue: Diffusion-aided image feature matching","venue":null,"work_id":"167fb02c-73d7-4e4f-8105-c8e27fd7e743","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:29.347751Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:f2abc245b16308d7df35f281eab1b12db4c90fa33252a2a3fbd69c4cf3e298ae","observation_id":"e38d7acc-1889-43f7-8ca8-e58f981098e6","resolution":{"observed_at":"2026-08-06T17:39:30.584616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:30.349412Z","title":"Mesa: Matching everything by segmenting anything","venue":null,"work_id":"6cfa8c26-fd07-4b44-bb9a-1b3dec8de547","year":2024},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:29.391843Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:f8cf406dea56fdc2b0ade93a46ba2d2d68beada206ed1c8b1d72211dc491736f","observation_id":"0105457e-345d-44ef-abc4-6841eb6c8711","resolution":{"observed_at":"2026-08-06T17:39:30.407579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:29.514537Z","title":"Unleashing text-to-image diffu- sion models for visual perception","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:29.514537Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:6d9da20d2d41926952d05c83a1b1243d725db262a10974fb883c4edfa84d8eeb","observation_id":"9e353c44-b44c-4873-b468-0e978bdc14db","resolution":{"observed_at":"2026-08-06T17:39:29.514537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:39:30.087575Z","title":"Pmatch: Paired masked image modeling for dense geometric matching","venue":null,"work_id":"62f96358-2e49-4419-9646-a9ea77d03e4a","year":2023},"citing_paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:29.580035Z"},"links":{"citing_paper":"/paper/2507.10318"},"observation_digest":"sha256:597ac1229ef1cccd477b4987c5f87f8278af849d2e11f0034aa244effe3dab76","observation_id":"99ebaf2a-ed60-458b-8219-a47bfbe0fe54","resolution":{"observed_at":"2026-08-06T17:39:30.196322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.10318","last_updated":"2025-07-14T14:28:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T10:52:31.961346Z","submitted_at":"2025-07-14T14:28:15Z","title":"Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":2,"verified_fuzzy":48},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 1 inbound Pith citation observation for arXiv:2507.10318."}