{"as_of":"2026-08-19T17:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:806c67e4745b7782a16f74ffe4362101933382a1ca79af70da73148940dc8508","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T07:40:23.337337Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21371/citation-record","integrity":"/paper/2607.21371/integrity","json":"/paper/2607.21371/citation-record.json","paper":"/paper/2607.21371"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:16.693808Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recog- nition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:16.693808Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:fa2ed4dc6323a11b38f8d87bec43548c6dc94af1b3b886ac5e4401db8afca2ea","observation_id":"72f4209d-6301-45ec-8a67-ddcf49284b81","resolution":{"observed_at":"2026-08-01T07:40:16.693808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:16.776806Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:16.776806Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:e6cd7c1d113f79ff8767a0a81c4a942181c1dc49110c45c79582ab1733580033","observation_id":"38193678-aff8-46ca-8511-cbf137a8ae3f","resolution":{"observed_at":"2026-08-01T07:40:16.776806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:16.852077Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:16.852077Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:47c1cd1f8a2f869e352d755ec024dd80178bfe6aedc0ce58f8ae27013d09dadf","observation_id":"b91ae615-acaf-4026-a985-5ee5537c1b89","resolution":{"observed_at":"2026-08-01T07:40:16.852077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:16.905763Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:16.905763Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:ba856966aef831ca0dcb966dc9e51f1342266df9b8f4b4a634a5811faa8a524b","observation_id":"1aa63614-1cc4-48b4-ad17-a1ad8120a89b","resolution":{"observed_at":"2026-08-01T07:40:16.905763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:16.946939Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:16.946939Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:a925580c243e976fd2f4ce4b6bee92db4173f23bfcda6c212667cad5560d48a0","observation_id":"1ba5e5de-c7e6-4a60-891d-65d92f5d3b9f","resolution":{"observed_at":"2026-08-01T07:40:16.946939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.011005Z","title":"In:ProceedingsoftheIEEEconferenceoncomputervisionandpatternrecognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.011005Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:17d8537cbcf26922c9b4f43d50c9880177b585f1944245bc38b8891dbc470432","observation_id":"8548f69e-de82-4d7f-9d8c-d93376b13b70","resolution":{"observed_at":"2026-08-01T07:40:17.011005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.091131Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.091131Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:e660b6e72197d7db074f295f2199b763cb8414e3d9f6c93d21617ec16c457a52","observation_id":"32d66f3b-045b-4664-9956-cb43c813e0d1","resolution":{"observed_at":"2026-08-01T07:40:17.091131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.143075Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.143075Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:6ff73a52a81274a64b480f10b42184496357a945b5b74201eb6b8282caf07bcf","observation_id":"a24bb0e0-1a42-48c7-987c-2a78147ca70e","resolution":{"observed_at":"2026-08-01T07:40:17.143075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.214480Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.214480Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:8f7a2a7bc7638ff36df8841fe26947f8bb04493009fd363e1a57037e292e2505","observation_id":"615382c0-bd3d-4bc6-ba71-19bbae663c45","resolution":{"observed_at":"2026-08-01T07:40:17.214480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.265831Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.265831Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:82d394b256752871c993d18628da81a9e2da31bbea12dfd1565a0e08e3798164","observation_id":"b516a120-c5d0-4569-b79e-b083ea08afe4","resolution":{"observed_at":"2026-08-01T07:40:17.265831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.337104Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.337104Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:78235f0118ea5bce4ccd26ccb72493be8ae830442ca83de6710479e82cfa9f38","observation_id":"8d702406-bc79-465d-9b9c-e229683bb340","resolution":{"observed_at":"2026-08-01T07:40:17.337104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.413922Z","title":"In: Proceedings of the European conference on computer vision (ECCV)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.413922Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:2547645e5df49ac215f0b7c0385c3e5834ad1de51d1eb41c7dac60b7050f1708","observation_id":"82de1b5a-5ff4-47c9-aab2-8c76b48e7212","resolution":{"observed_at":"2026-08-01T07:40:17.413922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.483022Z","title":"Advances in neural information processing systems31(2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.483022Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:1cbe2899239193751bd69671c20b055bc1f9ff05fae75417821614d54ee6cf63","observation_id":"efcf5ea3-c817-4ea7-b856-6c25a23f1be8","resolution":{"observed_at":"2026-08-01T07:40:17.483022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-16T01:18:27.067382Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-01T07:40:17.534398Z","title":"arXiv preprint arXiv:1504.00325 (2015) DINOde: Continuous Vision-Text Alignment for OVSS 17","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.534398Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:d7a77f2b2636ec878dce1d9f28432095f4d757f8c93c73df66671a19d2ec1c3d","observation_id":"5d6bf94b-8846-442c-bad4-d1f5b74f77d8","resolution":{"observed_at":"2026-08-01T07:40:17.534398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.604383Z","title":"Advances in neural information processing systems34, 17864–17875 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.604383Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:8f9c3293cf70a4d7f06ff54017c4652267257e52cb3dc03a2a3e1bf181cd8bb6","observation_id":"1c14e3a0-e4d4-4be9-b17c-f75cb650d9a5","resolution":{"observed_at":"2026-08-01T07:40:17.604383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.675339Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.675339Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:9bdeee4e7bf9072b3fdc5065731f56253f0d74377dd71a8a8ed811484a6962a2","observation_id":"5a062388-6299-454b-9893-98e048352b19","resolution":{"observed_at":"2026-08-01T07:40:17.675339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.726285Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.726285Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:b2d0ef525d46e32829fad1908da1b59f15937cb075118599839b50822d00fae0","observation_id":"cbc16b31-85b8-4498-9ca1-cb78ccdcb4e5","resolution":{"observed_at":"2026-08-01T07:40:17.726285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-01T07:40:17.767610Z","title":"arXiv preprint arXiv:2309.16588 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.767610Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:ea4aef4176b0d5e160fafbb3631ace55ae79aff2243b042bf5028ebfc59920bd","observation_id":"dfefadaf-a863-4de0-82ef-4c82b927f3d0","resolution":{"observed_at":"2026-08-01T07:40:17.767610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.837553Z","title":"Advances in neural information processing systems32(2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.837553Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:389a5e7d9a35da86813d7101fd6dacb03aa893fc00115bff89aefe35f48151b7","observation_id":"31b5c7d1-e777-40d9-b461-9a73f1ff60ad","resolution":{"observed_at":"2026-08-01T07:40:17.837553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:17.919632Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.919632Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:8afed62a4d882869ebd95aec9f33e80c8c25aaf7c00adc0ed65c011cb0c7ffc5","observation_id":"5e1b6986-d8a4-44e7-b87c-2d1ac0378418","resolution":{"observed_at":"2026-08-01T07:40:17.919632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03706","last_updated":"2025-06-04T08:36:56Z","snapshot_observed_at":"2026-08-14T12:51:12.203153Z","submitted_at":"2025-06-04T08:36:56Z","title":"OV-COAST: Cost Aggregation with Optimal Transport for Open-Vocabulary Semantic Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03706","snapshot_observed_at":"2026-08-01T07:40:17.970860Z","title":"arXiv preprint arXiv:2506.03706 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:17.970860Z"},"links":{"cited_paper":"/paper/2506.03706","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:b76393e89498a83bff1645b7b821460bf3a09ef1d8f0d3d043ad52bcb9507a56","observation_id":"61efe6ec-ec09-4db4-872a-3e2e77fbd26f","resolution":{"observed_at":"2026-08-01T07:40:17.970860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.018375Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.018375Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:b0f2df9f4b587ae93174a0ae2c5119e618510f596e6d01081225ce56c7080534","observation_id":"878f6313-20c0-4076-8f6a-34249dc2f6df","resolution":{"observed_at":"2026-08-01T07:40:18.018375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.120076Z","title":"In: 2025 IEEE/CVF Winter Conference on Applications of Computer Vision (WACV)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.120076Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:35953574fd718b8072b3667d1048063420139a0e85f8f7b358abb9c482befe28","observation_id":"b058c95d-4eaf-4e71-91b5-fde51487969a","resolution":{"observed_at":"2026-08-01T07:40:18.120076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.173412Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.173412Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:601c471b9b4ae3286f86cf30f9d5be859808a172cb29fc7890eb20e17ae62c35","observation_id":"a6305e01-b267-45b6-adea-e50d7f7c1d49","resolution":{"observed_at":"2026-08-01T07:40:18.173412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.228689Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.228689Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:173401482a2afa071b50ef61e1f72bfc9c91f1b71f9eb7d95f6884e7af02802f","observation_id":"a878428a-34ab-407c-8ebb-85aea571e493","resolution":{"observed_at":"2026-08-01T07:40:18.228689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.281047Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.281047Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:a2eb467fc2f4303e302a5fd337ca399056455a8bff006e874ff71b7865d4618c","observation_id":"e04091dd-72fe-4c7e-978f-33492d580ab0","resolution":{"observed_at":"2026-08-01T07:40:18.281047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.329316Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.329316Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:6b2abc61159fe3b2f3faf3b18e721a5a18646a9b08d2d93cbf293047c4c5fa9d","observation_id":"b88ef087-344f-42c4-bde5-beacb9f5c599","resolution":{"observed_at":"2026-08-01T07:40:18.329316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.381649Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.381649Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:2d337ad023391d478bebda29e5d2c63363de1dad3526889b6e52b4d7251ed13a","observation_id":"65ee1d57-6d32-4f5d-a5b0-46b5ddbd555a","resolution":{"observed_at":"2026-08-01T07:40:18.381649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.459247Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.459247Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:ba34cc88125402bf56392bb6bc8acb66f5624ddc1bde9fdb033f69a74e312cab","observation_id":"1548cd1c-95f8-4160-a21b-40fd11b12213","resolution":{"observed_at":"2026-08-01T07:40:18.459247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.538126Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.538126Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:95b3699a22b79f165f088a29c6aa358df4324d33aef4ba55abd6cd008920a2a7","observation_id":"39976649-810e-4e0a-9893-6c5f41dd5011","resolution":{"observed_at":"2026-08-01T07:40:18.538126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.590492Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.590492Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:e4bef54a0c9d3321d13b4abd81ea86274ed578c8a8f5ea1d379b62c813326118","observation_id":"d54a1efc-d4e1-4e1f-ba17-a475aa86b376","resolution":{"observed_at":"2026-08-01T07:40:18.590492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.638228Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.638228Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:f3e600791a898300d809134ce069eb5b112c44ab3427f463ca097824f0d59de3","observation_id":"6f07fdc4-7d56-4c32-bbb9-06493a72a412","resolution":{"observed_at":"2026-08-01T07:40:18.638228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.711283Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.711283Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:932a9ab99102dd3109af4c57bd8e28d4d695b0178f4b032b4c9e003761b7cbc6","observation_id":"ca706863-546e-424a-bfdf-1d1b94d72c77","resolution":{"observed_at":"2026-08-01T07:40:18.711283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.781464Z","title":"In: International Conference on Learning Representations (2022),https://openreview.net/forum?id=RriDjddCLN","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.781464Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:a16532b07bcfc2d6c813966b8ca62130f35197822950460d1c1b16880bd3bff9","observation_id":"d93f6e9c-34ff-40a2-b05d-419f292bae53","resolution":{"observed_at":"2026-08-01T07:40:18.781464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.871570Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recog- nition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.871570Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:b4ccac48da6ac01bf3a70420554e48ed0fa91cc5754ebaa10e35c2fb4c53f779","observation_id":"334c2309-876d-4ad6-b458-c8da357b4eda","resolution":{"observed_at":"2026-08-01T07:40:18.871570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:18.949906Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:18.949906Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:277fb26cd4e7fe0cee265d8088012e27f474871533e73d8631ae58b8902b9946","observation_id":"1db39108-6435-4de1-8dd7-51e82fe2706e","resolution":{"observed_at":"2026-08-01T07:40:18.949906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-01T07:40:19.023076Z","title":"arXiv preprint arXiv:2210.02747 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:19.023076Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:ee68185a44b1fd12a817fc81978dd202522d4e3566982cc3f0290318a5172dce","observation_id":"52c9159e-181f-4f9c-9416-35fbe0d204d6","resolution":{"observed_at":"2026-08-01T07:40:19.023076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03003","last_updated":"2022-09-07T08:59:55Z","snapshot_observed_at":"2026-07-06T13:49:40.974495Z","submitted_at":"2022-09-07T08:59:55Z","title":"Flow Straight and Fast: Learning to Generate and Transfer Data with Rectified Flow","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03003","snapshot_observed_at":"2026-08-01T07:40:19.107149Z","title":"arXiv preprint arXiv:2209.03003 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:19.107149Z"},"links":{"cited_paper":"/paper/2209.03003","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:da6abd074464fbd882a866f094a4f82c35126670c880b1324dbe9d966c9dd26d","observation_id":"ee0f6f73-a967-48f7-9324-329073c3af9b","resolution":{"observed_at":"2026-08-01T07:40:19.107149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:19.202308Z","title":"Advances in Neural Information Processing Systems33, 17548–17558 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:19.202308Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:f8db34d9b94e645eea6cb0a40a8e8adedb70fa4b512de0aebc24ee37952a9613","observation_id":"6df66102-c0a8-491b-b7fb-b84257f0d326","resolution":{"observed_at":"2026-08-01T07:40:19.202308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:19.325587Z","title":"In: International Conference on Machine Learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:19.325587Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:68b2ee871957164f1c7b83d827eb5985b3ac7f9e92bf5cf07ad864631426a0f5","observation_id":"560928b5-c6e2-4ac4-b0e3-23616809c667","resolution":{"observed_at":"2026-08-01T07:40:19.325587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:19.447085Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:19.447085Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:19bceab112f25f5275fc8344c8f227cd493cd00b592854deac97220e602e36fd","observation_id":"da3253bb-a888-4ca7-87c8-9c1a9e9e6747","resolution":{"observed_at":"2026-08-01T07:40:19.447085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:19.559072Z","title":"Advances in neural information processing systems33, 2503–2515 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:19.559072Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:34c690939548be5256bd93edcb46b8e0ea36febb6aeb36dda0adde485703c38c","observation_id":"b30874d8-9878-42bc-bc19-3987586126f0","resolution":{"observed_at":"2026-08-01T07:40:19.559072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:19.644026Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:19.644026Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:07605c755bf3b82fe5e921e6fe332a9e3d9099e1a9dcfb53eed009570879cc46","observation_id":"1083244f-ff0b-4a17-aae4-08ce85c7bef8","resolution":{"observed_at":"2026-08-01T07:40:19.644026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:19.762033Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:19.762033Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:da4e1b8a6ffe3d1dae515a58a79ebb8caafdcee555a69723f0a9efa3447596ee","observation_id":"cbf6f60a-19a8-4654-a14c-47ead2cc3b38","resolution":{"observed_at":"2026-08-01T07:40:19.762033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.14482","last_updated":"2026-06-11T10:07:56Z","snapshot_observed_at":"2026-08-16T02:46:49.800923Z","submitted_at":"2026-03-15T17:02:40Z","title":"V-JEPA 2.1: Unlocking Dense Features in Video Self-Supervised Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.14482","snapshot_observed_at":"2026-08-01T07:40:19.884363Z","title":"arXiv preprint arXiv:2603.14482 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:19.884363Z"},"links":{"cited_paper":"/paper/2603.14482","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:80ea684abe49be0f567f57580f72fdd42d28f817a3b7012e7c7bd28f1c615e03","observation_id":"7c712ee4-e3b5-46ca-bd55-e517a6413c94","resolution":{"observed_at":"2026-08-01T07:40:19.884363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-01T07:40:20.007080Z","title":"arXiv preprint arXiv:2304.07193 (2023) DINOde: Continuous Vision-Text Alignment for OVSS 19","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.007080Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:4d46419db478dfc29f1f23fbce1cb9028d9552fc2613c5dc4884704a4a2a2f0d","observation_id":"f83c0834-f7f9-4ac1-b9a0-03404430ce05","resolution":{"observed_at":"2026-08-01T07:40:20.007080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:20.127238Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.127238Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:cc19c27ff4bfde62314828e9613429da5fdb26103cd4f98912c13b8bea5f1d5b","observation_id":"d7b52e03-8e32-4903-8b93-796045b78819","resolution":{"observed_at":"2026-08-01T07:40:20.127238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:20.216097Z","title":"In: Inter- national conference on machine learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.216097Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:ae85d80e200ef1e5c8d14a4d47284ef5649db9dd1e5804126f5dd25b65d640b4","observation_id":"e51f63b0-8dd3-43f4-9036-bd7062daae27","resolution":{"observed_at":"2026-08-01T07:40:20.216097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:20.322150Z","title":"In: International Conference on Medical image computing and computer-assisted intervention","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.322150Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:e54798d468ddb5607cbcdc6e5f80fcdc304ff0d66e3f997aeccdac6741228a9b","observation_id":"3d1b7e0b-b6bc-42d5-85db-ff7d8f8ce89c","resolution":{"observed_at":"2026-08-01T07:40:20.322150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:20.437474Z","title":"In: Proceed- ings of the 56th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.437474Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:d537719bb3e6c3e4885a5a0d9f51b1a97f396f7745db34e83a28751efabde2a3","observation_id":"365b4457-32a1-46ab-896d-eaa8fce26182","resolution":{"observed_at":"2026-08-01T07:40:20.437474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:20.511875Z","title":"Advances in Neural Information Processing Systems35, 33754–33767 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.511875Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:eac13514d9e8f3a6326cde624efc4afb15da4971a02711991b1347724e2eb359","observation_id":"c6430f8d-5115-4dd5-a71d-0506b845fd66","resolution":{"observed_at":"2026-08-01T07:40:20.511875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14279","last_updated":"2021-09-29T09:01:07Z","snapshot_observed_at":"2026-08-16T17:53:12.658202Z","submitted_at":"2021-09-29T09:01:07Z","title":"Localizing Objects with Self-Supervised Transformers and no Labels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14279","snapshot_observed_at":"2026-08-01T07:40:20.635579Z","title":"arXiv preprint arXiv:2109.14279 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.635579Z"},"links":{"cited_paper":"/paper/2109.14279","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:e7db24fbbedad21ebabbf1423d2d5098e6e014836add70ff88fc5406dd05e273","observation_id":"cee11d61-f7d9-410b-9c72-da34172b2584","resolution":{"observed_at":"2026-08-01T07:40:20.635579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-08-18T01:07:23.737664Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-01T07:40:20.761071Z","title":"arXiv preprint arXiv:2508.10104 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.761071Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:a8a89b2f266815a786dcbdd840938f99ad9710497bd42489f11dbccbb26e776f","observation_id":"b6e87052-92fa-474f-a502-e5676dedc8f5","resolution":{"observed_at":"2026-08-01T07:40:20.761071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:20.849924Z","title":"In: proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.849924Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:ecdc81aebf0b73fa145084734e5d928e1e4e634ce0595572c2e046c6ccc820c3","observation_id":"3f5776ae-c8cc-4b0a-ad47-6200b5714390","resolution":{"observed_at":"2026-08-01T07:40:20.849924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:20.968018Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:20.968018Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:32d5cd5ce7b695a2ec82c59da28f12bf6409df079ca377a2fd3353325f3692db","observation_id":"7c08d5da-9ca6-4d65-bde9-304688b424e6","resolution":{"observed_at":"2026-08-01T07:40:20.968018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.067271Z","title":"In: Proceed- ings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.067271Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:d5e193e42973b03752aa0177bfcfb0d07b9f35ba60171769b76ec811d1ad9082","observation_id":"bd74770f-1225-4426-8a6f-8e1b3ad02411","resolution":{"observed_at":"2026-08-01T07:40:21.067271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.185848Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.185848Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:573ce885e8892ab420cd25b258600a3683a03030898c32e6eb9c997d492a6514","observation_id":"0e014fe4-6bee-4761-be9c-8f3329f8849b","resolution":{"observed_at":"2026-08-01T07:40:21.185848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.245590Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.245590Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:87c7de25b00f6e6450043a59ac1e5d5d6abd765d2188ec6fbf8a76d21e3e6569","observation_id":"2edb8d19-f4a6-4642-b246-dbae0ed8c12d","resolution":{"observed_at":"2026-08-01T07:40:21.245590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.251032Z","title":"IEEE transactions on pattern analysis and machine intelligence45(12), 15790–15801 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.251032Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:935abdbb005de8a5909db5fbe348df17838cd9cd020a57e62405497d577aeb7c","observation_id":"a0532b57-21ab-4c65-a602-65015e16509b","resolution":{"observed_at":"2026-08-01T07:40:21.251032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.269783Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.269783Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:76a9020cbc4444dc73bdbdd7c83c27fa4535d7288ead6e9f5aa99b1fc74c4609","observation_id":"e0598853-8b68-459d-9912-e0b6acfcc8f6","resolution":{"observed_at":"2026-08-01T07:40:21.269783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.428292Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.428292Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:4d7199eb8a552e835fe874175080451445c6c72fac07b15b2f684bc1dff4e8df","observation_id":"fc690a68-3acb-437e-8e22-f540e1b7f615","resolution":{"observed_at":"2026-08-01T07:40:21.428292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.543877Z","title":"Advances in neural information processing systems34, 12077–12090 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.543877Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:0bfe09b6d65c35b10930b232c1ef025649c2101db906c4ae08a712e22e027f9c","observation_id":"5028f612-5369-4b2b-afae-ec1729c461b2","resolution":{"observed_at":"2026-08-01T07:40:21.543877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.688368Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.688368Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:5b878f3b3d1dc74b042b57103f6295ad7619cc5ade4df38aa8dafc2510ac3d0d","observation_id":"807ac49a-e08f-4b95-ac22-2d65745faae2","resolution":{"observed_at":"2026-08-01T07:40:21.688368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.782619Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.782619Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:d92fc269f8ec379afa05461f42cc72f067053e990ad7f1d43bb4f5576e0e1915","observation_id":"9fadf9cc-636d-4bdc-9544-a4de39e53d59","resolution":{"observed_at":"2026-08-01T07:40:21.782619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.829934Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.829934Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:425c3e79094687ab7b792311f637f7a23c833a2f12afd872d119b7d3d9025130","observation_id":"d093b7b9-0e96-4b30-8d8c-6fb88e876172","resolution":{"observed_at":"2026-08-01T07:40:21.829934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.871342Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recog- nition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.871342Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:e163df5e4babea465630d3cf9dbe1f812ea7b057e91a5a28fff06c1f52c73399","observation_id":"5c07dd39-57ee-47a4-8d6b-9d2d06e91fc2","resolution":{"observed_at":"2026-08-01T07:40:21.871342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.898253Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.898253Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:825ad732226df8f1e2f5aa21dad7f6f99e8577a6e228af296e36ab411af452aa","observation_id":"0cfcfd22-4bb9-489b-80b4-181cb48dc248","resolution":{"observed_at":"2026-08-01T07:40:21.898253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.937501Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.937501Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:2210edc45f3985fd605603499c68f6569d7e67ce3a99249f7c856e5f8b658c20","observation_id":"56fb6e76-1627-4eea-a75a-f9a6d967f0ff","resolution":{"observed_at":"2026-08-01T07:40:21.937501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:21.983850Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:21.983850Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:eada24ec8329a9c86a8574aa460f052843ff371536cc81a5b614d24bd7654f3b","observation_id":"2ac74284-a36f-45fe-8383-e40131f107cd","resolution":{"observed_at":"2026-08-01T07:40:21.983850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.043900Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.043900Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:34041fcac0c362ce2f9c44c4820717b4f1caf54f6e8040d861bd6d0d4a847dc2","observation_id":"63b93f90-8378-475b-a8db-a1ca9f8eee05","resolution":{"observed_at":"2026-08-01T07:40:22.043900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.125955Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.125955Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:c6b0373d73df441d234de4f9071dc9cadc3c8a3b8939b379cd4115a399bf2ad0","observation_id":"39adc645-8ba7-413b-86af-d58fcc3fc85a","resolution":{"observed_at":"2026-08-01T07:40:22.125955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.240638Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.240638Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:0a3fa36ed7a0251c4124a94f6e2d523eadb60e0245826b02f8dc7426bbb447e2","observation_id":"e0b7bf65-e8a7-4282-961f-338ba6ef7108","resolution":{"observed_at":"2026-08-01T07:40:22.240638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.333890Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.333890Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:804d4de3b2eb27ca8b8200e0b8e8e46f271df2bb4471678a946b566edca51f18","observation_id":"17157c53-b5ef-4bd2-90ca-89962fa27f38","resolution":{"observed_at":"2026-08-01T07:40:22.333890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.451095Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.451095Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:ad5351114247e279a197a6f652bdde352ebdabf085e89065487d263ae29f6fde","observation_id":"f99400db-bbc3-460a-a2bf-f254fe966658","resolution":{"observed_at":"2026-08-01T07:40:22.451095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.485622Z","title":"Advances in Neural Information Processing Systems36, 32215–32234 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.485622Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:7501915e3f5432032d1b78577491f155ad099766e791788e633d42394714bf3f","observation_id":"e2201288-a6c1-457e-ab9d-24013a43a91a","resolution":{"observed_at":"2026-08-01T07:40:22.485622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.564721Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.564721Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:564a5e2ccad9b3c9d460b385d3d7f9867766ae64f1cba063402174f2b02c4fa1","observation_id":"f1c480cb-9916-472b-9231-0b317a1a0676","resolution":{"observed_at":"2026-08-01T07:40:22.564721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.659146Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.659146Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:7d39fe82c2fa23c4e68fd3eaf1dd63f1d9a343d996bfd5323380215051e611a8","observation_id":"211449f5-9e05-4e76-8165-39930ac5a627","resolution":{"observed_at":"2026-08-01T07:40:22.659146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.796740Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.796740Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:5d22c811be1fb29faa77a76dcda153c39d17f8effb8c1c64b9c4e4d90c0f0002","observation_id":"4963a0c5-fac6-4e57-b866-9e4d8d83a79d","resolution":{"observed_at":"2026-08-01T07:40:22.796740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:22.901598Z","title":"In: International Conference on Machine Learning (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:22.901598Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:67bd538f370c3aa7cc44a0f3c158ba8441bc29032a5b3df3de8879f2b0dc7f1a","observation_id":"457936c3-c74b-495b-ad9e-ecb9837f04d5","resolution":{"observed_at":"2026-08-01T07:40:22.901598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:23.033716Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:23.033716Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:e75c33c84060683580b4b644cbbbd00638dfa3033806112c6e499ac1713b043c","observation_id":"2e349262-56f0-49b6-8809-dec3967f80fc","resolution":{"observed_at":"2026-08-01T07:40:23.033716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:23.094277Z","title":"International journal of computer vision127(3), 302–321 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:23.094277Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:4e21e769a84088448d2870a0230fbe121abe0f678d675eb4a8cb30da6901545d","observation_id":"69835ccb-c2c3-45ed-8f5c-8a34817a4f41","resolution":{"observed_at":"2026-08-01T07:40:23.094277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:23.166884Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:23.166884Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:109d0feedd606e42fc09280b73f1b13095923eca6a33db934af7db9d6dee3c0c","observation_id":"98cd83d0-4ce8-45e1-ba3e-a1d9a1ad0c00","resolution":{"observed_at":"2026-08-01T07:40:23.166884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07832","last_updated":"2022-01-27T09:20:49Z","snapshot_observed_at":"2026-07-06T12:08:39.149450Z","submitted_at":"2021-11-15T15:18:05Z","title":"iBOT: Image BERT Pre-Training with Online Tokenizer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07832","snapshot_observed_at":"2026-08-01T07:40:23.235845Z","title":"arXiv preprint arXiv:2111.07832 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:23.235845Z"},"links":{"cited_paper":"/paper/2111.07832","citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:23a65fafbe74ff7747442c9c004195e6d83e1442e50610a2b18c46709ac140dc","observation_id":"3ea9a268-e319-4b50-9b30-2124dad99346","resolution":{"observed_at":"2026-08-01T07:40:23.235845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T07:40:23.337337Z","title":"In: Proceed- ings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-01T07:40:23.337337Z"},"links":{"citing_paper":"/paper/2607.21371"},"observation_digest":"sha256:0ce482770b7cf19cd6700b9d5d981b37efbb829b0b061205be2f1d8a003cd806","observation_id":"46839edd-3d62-433f-8047-c6339a77f4d9","resolution":{"observed_at":"2026-08-01T07:40:23.337337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21371","last_updated":"2026-07-23T14:37:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T02:47:37.653045Z","submitted_at":"2026-07-23T14:37:27Z","title":"DINOde: Continuous Vision-Text Alignment for Open-Vocabulary Semantic Segmentation"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":84,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 0 inbound Pith citation observations for arXiv:2607.21371."}