{"as_of":"2026-08-09T18:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7881a995a41c109cc094b1685ba99f6e8ae12bb35e2aa9ab28fa0fcdf5f35cdd","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T16:25:11.684696Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.06219/citation-record","integrity":"/paper/2502.06219/integrity","json":"/paper/2502.06219/citation-record.json","paper":"/paper/2502.06219"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.831659Z","title":"Segment Anything,","venue":null,"work_id":"f8dda387-56a1-4bba-bcad-b2b07bfdfdeb","year":2023},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.451706Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:5bb01c9003408890585608c243a6278767b199ae8d892ac5b50ca2e91cc0dc84","observation_id":"41472a22-b086-4ea7-8896-ea43477dcc58","resolution":{"observed_at":"2026-08-08T16:25:12.834973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-08T16:25:11.456332Z","title":"DINOv2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.456332Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:ad091bc171aaae0b3bf2257016c677289ace2830ff62b24b8480e0b986ebb2bc","observation_id":"3f82574d-1afd-4eec-81f4-ae4613d7b267","resolution":{"observed_at":"2026-08-08T16:25:11.456332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.820579Z","title":"Depth Anything: Unleashing the power of large-scale unlabeled data,","venue":null,"work_id":"b8dbfbbb-9033-4910-ab2f-366031c4e853","year":2024},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.460888Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:8cec604e24f019af8f2ef40ca9f6dceffee41f3cc5d75056b0dee301da2adec3","observation_id":"24028990-b372-4d07-9ed3-be37086f36b2","resolution":{"observed_at":"2026-08-08T16:25:12.824846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.811789Z","title":"ViPOcc: leveraging visual priors from vision foundation models for single-view 3d occupancy prediction,","venue":null,"work_id":"6bb6d51e-588c-46f8-9784-02170cb66de0","year":2025},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.464820Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:680ab866d76cb254ed63242bd33005f312aec5e2fd0702df8080d14ebd337cfc","observation_id":"ca7be2aa-d027-4b63-bcc4-cbda744d06b5","resolution":{"observed_at":"2026-08-08T16:25:12.815059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.801118Z","title":"Few-shot object detection with foundation models,","venue":null,"work_id":"7f688925-7349-4702-8479-66ac67f4c180","year":2024},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.469901Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:0c0b1c621e5db60fe42ee1a478db504d9f366531a9e0526daefcdfecb9a4fe4c","observation_id":"0855217d-b926-4607-a657-5752c53b4758","resolution":{"observed_at":"2026-08-08T16:25:12.805161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.325862Z","title":"Playing to vision foundation model’s strengths in stereo matching,","venue":null,"work_id":"7dcdf2f9-6b36-42e7-85fc-9ba5dd6b9e47","year":2024},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.473442Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:8121ea31fa984d227c16d66ba73ab12dca75098b805fdb98ab74933e44da9750","observation_id":"cb7b4d2e-d352-43dd-b883-f832a4d4ff8d","resolution":{"observed_at":"2026-08-08T16:25:12.332395Z","resolver_source":"arxiv_id_nonexistent","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.792246Z","title":"Joint depth prediction and semantic segmentation with multi-view SAM,","venue":null,"work_id":"7bda65bd-4b46-4821-953b-cb1a1f56f8f0","year":2024},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.477627Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:e5dd277b90ae6ed30ee65145adab11e5e9a2b3b5b327d7765f4bcf6f74794789","observation_id":"b8b0b805-0a0e-47a9-bd05-bb95681f19b0","resolution":{"observed_at":"2026-08-08T16:25:12.795495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.782159Z","title":"Bridging the domain gap: Self-supervised 3D scene understanding with foundation models,","venue":null,"work_id":"1d0d2f88-1dff-4430-9041-8bc08aff6434","year":2024},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.481201Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:2a00175c6b9f3391cb901d61e8ca5064d7b4b5a17c988213a129ed94f95ca4c2","observation_id":"74a75f9d-e5cc-4362-a255-6301f75a3107","resolution":{"observed_at":"2026-08-08T16:25:12.786444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.772532Z","title":"HAPNet: Toward superior RGB-Thermal scene parsing via hybrid, asymmetric, and progressive heterogeneous feature fusion,","venue":null,"work_id":"bb467fcb-37b0-4dbd-ab5c-2dc03a4db2c9","year":2024},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.484852Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:218d449d52dbdffc4695f42772e7e9d9e9bec863be8af476dab21706e7c6f397","observation_id":"48d3e431-7b6a-4ffa-a611-97aeba967610","resolution":{"observed_at":"2026-08-08T16:25:12.776211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.763078Z","title":"SNE-RoadSeg: Incorporating surface normal informa- tion into semantic segmentation for accurate freespace detection,","venue":null,"work_id":"675d3c92-2824-46e3-8573-3eaed334f9f7","year":2020},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.488446Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:d38b8c4ad7304de10c853c83b24e4002d519e8a1612862b995a422d56be2ddad","observation_id":"1f57d1fd-2352-4186-9627-20e797d6e456","resolution":{"observed_at":"2026-08-08T16:25:12.766764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.753301Z","title":"ORFD: A dataset and benchmark for OFF-Road freespace detection,","venue":null,"work_id":"0d4a5485-b7cf-497c-9e5b-ff1a56df015e","year":2022},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.491894Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:ed3841e804c396d4ff8c5422f6a8a97164667e817d51becbd39c0675f0571fda","observation_id":"aab1c3bf-9713-4b57-a360-1ddd9f7e1830","resolution":{"observed_at":"2026-08-08T16:25:12.756913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.744108Z","title":"MFNet: Towards real-time semantic segmentation for autonomous vehicles with multi-spectral scenes,","venue":null,"work_id":"b1b25f01-d60f-4bc1-89da-6db84f5dd92d","year":2017},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.495708Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:693b43bc6c6ece976c047f440a94ea23db8e16de086b337d3f80b70309643f17","observation_id":"c7853cfe-b833-44f2-90e5-dfd9fd4165c3","resolution":{"observed_at":"2026-08-08T16:25:12.747624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.733849Z","title":"FuseNet: Incorporating depth into semantic segmen- tation via fusion-based cnn architecture,","venue":null,"work_id":"e0bb433e-33ce-444b-b5cf-5580441ba217","year":2017},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.499203Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:f0d494eb6f31006a4b8fb3a63746f21c68130a0c59a9b6cdc167a531862f1301","observation_id":"018996a5-b763-4d45-b3ef-c29b1a5fbcaf","resolution":{"observed_at":"2026-08-08T16:25:12.738312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:11.502948Z","title":"Pothole detection based on disparity transformation and road surface modeling,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.502948Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:a5ef33f02574fcca2d20a435d6e20986aa7b4ba32d196ec42c903cd75b9dd79b","observation_id":"c04e323e-77f4-4382-beae-fc4ccf66befc","resolution":{"observed_at":"2026-08-08T16:25:11.502948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:11.506076Z","title":"Graph attention layer evolves semantic segmentation for road pothole detection: A benchmark and algorithms,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.506076Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:b12f53b471884f9179d46f9225ddd9004c626bd75d32e52d6ac9bbc1ee5ee751","observation_id":"fb4b7827-da95-49d3-85b8-b990031a1d4c","resolution":{"observed_at":"2026-08-08T16:25:11.506076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.714190Z","title":"These maps are made by propagation: Adapting deep stereo networks to road scenarios with decisive disparity diffusion,","venue":null,"work_id":"bda1ab45-e31e-4309-a221-4353bc070199","year":2025},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.510441Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:8ae54d30699af85f57287ccff7c9bde6d350224a1c287bfe643e1405717da3d3","observation_id":"eb8a03d2-c152-4b05-8ee2-e28ae265f70f","resolution":{"observed_at":"2026-08-08T16:25:12.718021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:11.513528Z","title":"S 3M-Net: Joint learning of semantic segmentation and stereo matching for autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.513528Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:c7534eac50b09092df447e5ee979081aa72fcb342384939f2e22e97c09fc4165","observation_id":"14a4831a-9701-44d3-bd0d-6189243d23dd","resolution":{"observed_at":"2026-08-08T16:25:11.513528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.114499Z","title":"Online, target-free LiDAR-camera extrinsic calibration via cross-modal mask matching,","venue":null,"work_id":"16704392-68ce-4460-bc1b-82e68e588207","year":2024},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.516726Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:982adc13e598b38b2e48c017601089062aac2e1cc7a496b75805e9de713d7180","observation_id":"8cd1df51-977a-43dd-ae37-70b9c5c6981a","resolution":{"observed_at":"2026-08-08T16:25:12.118176Z","resolver_source":"arxiv_id_nonexistent","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09414","last_updated":"2024-10-20T11:24:09Z","snapshot_observed_at":"2026-07-06T18:30:32.982860Z","submitted_at":"2024-06-13T17:59:56Z","title":"Depth Anything V2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09414","snapshot_observed_at":"2026-08-08T16:25:11.519939Z","title":"Depth Anything V2,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.519939Z"},"links":{"cited_paper":"/paper/2406.09414","citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:f7f7f5dbc5e787d0b69931a02310e5558865381d488d5aa9b5f095acb9993393","observation_id":"65420ead-46fe-48d2-863f-ec9a21ba3c07","resolution":{"observed_at":"2026-08-08T16:25:11.519939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.698557Z","title":"Three ways to improve semantic segmentation with self-supervised depth estimation,","venue":null,"work_id":"42c282c9-3ff6-4d7e-b054-8446356c210f","year":2021},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.523504Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:341665c84000310a248562c046309273b3a2d3938cc070142ac6d25ee7012883","observation_id":"c79956bc-c4dc-4ee8-b51a-4dcf2fb59d65","resolution":{"observed_at":"2026-08-08T16:25:12.701826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.688255Z","title":"Learning to relate depth and semantics for unsupervised domain adaptation,","venue":null,"work_id":"9325b288-f05a-4e05-8420-e7ee472b334f","year":2021},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.526672Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:c6dbdc137c36f7c6271d9155704826d1f8da5e60c6c4c8c6d73265e133f987d5","observation_id":"dfc2c004-1977-4714-85c0-f9016b786783","resolution":{"observed_at":"2026-08-08T16:25:12.692021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.678445Z","title":"Efficient RGB-D semantic segmentation for indoor scene analysis,","venue":null,"work_id":"6c5acdb1-077e-4a73-9d8b-0959afe85a35","year":2021},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.529959Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:0d54709652c8d6c53ed8d4feeee45a62283f621a4aadbecfbc4a338896cacc16","observation_id":"0352351d-59fa-4716-8ae5-ca38c982b5d7","resolution":{"observed_at":"2026-08-08T16:25:12.681832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.669960Z","title":"Learning common and specific features for RGB-D semantic segmentation with deconvolutional networks,","venue":null,"work_id":"09490a51-6f0d-4f13-b08b-31d5ce7c9007","year":2016},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.534282Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:b85121d384b6682823d277bce65cc35a043752f26913beb1f935af1b1dd38473","observation_id":"7d5b379e-3d68-4745-96ef-287ca6103bac","resolution":{"observed_at":"2026-08-08T16:25:12.673463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.661539Z","title":"Vision Transformer adapter for dense predictions,","venue":null,"work_id":"b7164ddc-977a-424c-bdca-f780f4f650b7","year":2023},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.537937Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:01ae18c5dcd7271c967780f277cc06b97a7d4764d1cc132ed89600c46692fee1","observation_id":"15ef4444-3369-4525-9d17-0e1953c9a136","resolution":{"observed_at":"2026-08-08T16:25:12.665057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.652592Z","title":"Conv-Adapter: Exploring parameter efficient transfer learning for convnets,","venue":null,"work_id":"187e784e-4811-4ab6-8b4b-869d9dd7beda","year":2024},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.541597Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:806ccb9d55a1f3bade90eb7e9ca24a7c7ebfec22d0036f947bb6dfb314136270","observation_id":"b88d98a5-a661-4a4f-ad47-acbb37c19514","resolution":{"observed_at":"2026-08-08T16:25:12.656003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.644488Z","title":"CANet: Co-attention network for RGB-D semantic segmentation,","venue":null,"work_id":"083798fa-c022-4417-ad25-76db78a4d864","year":2022},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.545087Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:c1203c4e490e29c531bf9612430d27ba94904bac8e4f7c383c97e51b6fbba097","observation_id":"d4eb69f5-59d7-4806-b38f-52e78824364c","resolution":{"observed_at":"2026-08-08T16:25:12.647764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.636602Z","title":"FANet: Feature aggregation network for RGBD saliency detection,","venue":null,"work_id":"43536604-d8b4-48f1-acc9-c595b469c9f0","year":2022},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.549219Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:d06a2afec02b3b8f53af0af766afb8794a5b35d3b8c4a3761e9f31c5ee6740c2","observation_id":"bfbf7981-d7d8-444b-bee3-bad880e5feb5","resolution":{"observed_at":"2026-08-08T16:25:12.639199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.627932Z","title":"RoadFormer: Duplex Transformer for RGB-Normal se- mantic road scene parsing,","venue":null,"work_id":"4dd65ced-71f9-4e7c-ba3c-c18ddc9422b7","year":2024},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.552770Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:ea5b740bb42f5239b3ddd30e4a9fec4d87eb15c50aecbbd81c3c878616a18fe2","observation_id":"953dd1ee-5849-4015-8fcc-67036bbe74af","resolution":{"observed_at":"2026-08-08T16:25:12.631347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:11.915170Z","title":"Roadformer+: Delivering RGB-X scene parsing through scale-aware information decoupling and advanced heterogeneous fea- ture fusion,","venue":null,"work_id":"c69919dd-9edd-41f7-946b-66dd0839488f","year":2024},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.558380Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:afbb6f443c2819a47f37284e2c5a0c9943609d13479c0c695164531e2265c883","observation_id":"f7426f7f-a33d-4f4b-a048-edad1aba2a22","resolution":{"observed_at":"2026-08-08T16:25:11.921112Z","resolver_source":"arxiv_id_nonexistent","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.618254Z","title":"ViT-CoMer: Vision Transformer with convolutional multi- scale feature interaction for dense predictions,","venue":null,"work_id":"9d8dbff0-b2e1-4818-b77c-14f519f50e58","year":2024},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.561575Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:0b84d44f7769236a3b370b03d01ce27441bdfffdf4cc57732ba8e8587da928cc","observation_id":"e6b4ada9-9a0e-4881-965b-a6e7dc4dd7f6","resolution":{"observed_at":"2026-08-08T16:25:12.621660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.608496Z","title":"Robust RGB-D fusion for saliency detection,","venue":null,"work_id":"1b4c56d9-fc64-46aa-9a13-e30a77db5f4b","year":2022},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.567193Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:d03fa6eeb354c9597fd8e45ab2a2e37e83a0143ce6204441229637a40250e30a","observation_id":"48225242-1d99-486d-8257-b9ad1d1dbeab","resolution":{"observed_at":"2026-08-08T16:25:12.611392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.599951Z","title":"Deep RGB-D saliency detection with depth-sensitive attention and automatic multi-modal fusion,","venue":null,"work_id":"37c177a8-f57d-4b7a-b1aa-b278ff6dd18f","year":2021},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.574017Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:35f77ab21a5c348b3f8b305a5c8aabde137b5f74f0a04ea038d0e3163abc0000","observation_id":"1e11e41a-b747-4583-a352-3c5f4a60cdf0","resolution":{"observed_at":"2026-08-08T16:25:12.603295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.590348Z","title":"Gated fully fusion for semantic segmentation,","venue":null,"work_id":"95709d3b-b933-4592-99e6-fed4b299de57","year":2020},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.581772Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:ebe47738bf13308fc2bf4955db7eab2e72382fc48357903d708aa74aa858f02f","observation_id":"48e835b7-dce4-4c9f-b190-cb2478203466","resolution":{"observed_at":"2026-08-08T16:25:12.593838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.580501Z","title":"UNet++: Redesigning skip connections to exploit mul- tiscale features in image segmentation,","venue":null,"work_id":"db323d23-f5c8-4e6b-bd40-1210ed7584f2","year":2019},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.584871Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:e9c7a13886ea31391f14302c0e4a10b06a642f254d5eb0a13f05efd725ce4540","observation_id":"9cd85a02-5e53-4b0c-b24f-4972c31ab24b","resolution":{"observed_at":"2026-08-08T16:25:12.583558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.573747Z","title":"The CityScapes dataset for semantic urban scene understanding,","venue":null,"work_id":"4b89370e-76d1-47c7-abdc-a2d7d4883973","year":2016},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.587678Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:546843584436e9697c1036efe7f85e88669efcb3ae8bcfd7af3d97d264d1a2d4","observation_id":"2afaff98-9826-453a-8f12-f529e16e30fd","resolution":{"observed_at":"2026-08-08T16:25:12.576201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.566426Z","title":"Object scene flow for autonomous vehicles,","venue":null,"work_id":"f35585e4-5fcd-4cf6-81a7-29fa4bf7fa9a","year":2015},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.590919Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:2e4d3867b91c7bacce5885cd1dd6f589831c8acdd3a69e77a0ea573fec262171","observation_id":"6058c9bf-cecc-4cc5-a801-9421b09498cd","resolution":{"observed_at":"2026-08-08T16:25:12.569050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.558527Z","title":"Deep multimodal fusion for semantic image segmen- tation: A survey,","venue":null,"work_id":"2ff708a0-f78f-4125-a088-a44519591c00","year":2021},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.593718Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:5ae2d24e666443cebb675b4c7a1e78a386610d80902f86527585ddac065ae0bd","observation_id":"1d2dab68-5bdd-4042-9484-d5bf5526edbb","resolution":{"observed_at":"2026-08-08T16:25:12.561524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.549953Z","title":"AdapNet: Adaptive semantic segmentation in adverse environmental conditions,","venue":null,"work_id":"3b4842ef-12d7-4d75-8973-332a769c6317","year":2017},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.597051Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:5f3fbcdbd4708135c2d51662d01750d3e19d2b6788f167924c588bcfc7dc05e4","observation_id":"5023d47f-5813-44b8-8fce-187d7f0f41c8","resolution":{"observed_at":"2026-08-08T16:25:12.553147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.540579Z","title":"Locality-sensitive deconvolution networks with gated fusion for RGB-D indoor semantic segmentation,","venue":null,"work_id":"44e1a52f-e69b-4431-9b29-4ea8c2919a2a","year":2017},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.600772Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:3f06e2417300cdeaf5f427195d110fdae06ea7d7216b3f8f3858c49788b0dc2c","observation_id":"bf847e64-262b-413a-8754-8f96812d3c96","resolution":{"observed_at":"2026-08-08T16:25:12.544148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.531002Z","title":"Learning feature fusion in deep learning-based object detector,","venue":null,"work_id":"fc587359-cefc-44ff-820b-549b0947526d","year":2020},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.603326Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:67cc8b2321644da0749d752a98df8aed019c6e2c9dfba7fe5eb69465916b7e53","observation_id":"4751ecc7-971c-4ed1-bda4-170129d68b2e","resolution":{"observed_at":"2026-08-08T16:25:12.534756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.522115Z","title":"ECFFNet: Effective and consistent feature fusion network for RGB-T salient object detection,","venue":null,"work_id":"4e59bdaf-b598-4153-82d9-7e16805cbc3f","year":2021},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.606353Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:c517f34c4d767366a69c0b75b986669b3fd10480516bda458aa7eaabb4f47994","observation_id":"bb2e1da9-ef83-4cbd-b2af-84065e5b9121","resolution":{"observed_at":"2026-08-08T16:25:12.526031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.511868Z","title":"Salient object detection: A discriminative regional fea- ture integration approach,","venue":null,"work_id":"ed226101-c5b4-4f9a-b411-d490cecc12a9","year":2013},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.608665Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:1679ab2fd58ceacc9d9cde000a4a97509289b20ba5c9a64142907c4d4f0875bb","observation_id":"22679d88-500f-4e3c-8865-cbcadddf3d14","resolution":{"observed_at":"2026-08-08T16:25:12.515641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.503221Z","title":"ExFuse: Enhancing feature fusion for semantic seg- mentation,","venue":null,"work_id":"5a08e1f4-e674-472d-8f87-3008c5d84a8b","year":2018},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.611713Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:64a750639ec620e185e993e23e004031bf63d3a2cf032ede39c8e7ee07a2c4bf","observation_id":"c5c6b398-7c2d-4748-9358-e043bd16fa54","resolution":{"observed_at":"2026-08-08T16:25:12.506533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.492880Z","title":"Bi-directional cross-modality feature propagation with separation-and-aggregation gate for RGB-D semantic segmentation,","venue":null,"work_id":"eb8dadbf-3fa3-465f-ad3c-55c7178c08bb","year":2020},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.614998Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:d2b177f6b4e006558999427bf9de58b144b5da35b81e745222f3e88d834e312c","observation_id":"51271020-d4f6-4fb9-b8c7-5acb55db4ad2","resolution":{"observed_at":"2026-08-08T16:25:12.496721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.483483Z","title":"F 3Net: fusion, feedback and focus for salient object de- tection,","venue":null,"work_id":"da955ea9-8403-4d58-8a72-5eedfe540818","year":2020},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.619021Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:2bd2c0b22bb27a664bad95009bb4322a72c84b171da0791b9bf480e00780c5c9","observation_id":"5edfd81e-1604-45e5-870e-339670ac144f","resolution":{"observed_at":"2026-08-08T16:25:12.486806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.475762Z","title":"Incorporating convolution designs into visual Trans- formers,","venue":null,"work_id":"2e08bb08-9071-47bd-9624-a34be46ae4f6","year":2021},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.621829Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:7aee8474f6f0fba6b67abfe3c2fbe12ca906e085b9817070a8c1494bed03e52b","observation_id":"079cd268-90e8-48e9-826b-55dfc982d192","resolution":{"observed_at":"2026-08-08T16:25:12.478599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.467730Z","title":"EfficientNet: Rethinking model scaling for con- volutional neural networks,","venue":null,"work_id":"3bcb2a63-d4b0-455f-b9d1-db37a84ff804","year":2019},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.625061Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:c2a0d466b4b6fff9c7f64fe346b3617ca3057cfd03ddf0b8d7ccf9d720af4f43","observation_id":"aed10c1f-44c6-4eb2-8858-47144e9d5214","resolution":{"observed_at":"2026-08-08T16:25:12.470722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.459273Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"17ee3814-e2f2-47d6-8918-5f07633a8fda","year":2016},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.628622Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:49adc999a79941efae7c8b5f8c7d01d6171f8f1c300ecd3afb3be2e717fd4966","observation_id":"4e0189f4-33e3-4e30-b428-c8f3ad491b92","resolution":{"observed_at":"2026-08-08T16:25:12.462329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.450336Z","title":"Real-time fusion network for RGB-D semantic seg- mentation incorporating unexpected obstacle detection for road-driving images,","venue":null,"work_id":"f31b4aa7-eb7f-427f-bc92-172305904067","year":2020},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.631595Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:7b6d6319c8688f661d60f136a51216f9ea10be67462b6a048e58433fd4ac36bf","observation_id":"20171956-b619-43aa-9a69-6c536147657b","resolution":{"observed_at":"2026-08-08T16:25:12.454177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.441230Z","title":"THCANet: Two-layer hop cascaded asymptotic network for robot-driving road-scene semantic segmentation in RGB-D images,","venue":null,"work_id":"3839622c-4801-43e7-897c-ca6d79c5b9e9","year":2023},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.634654Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:3be20cfeebbad03899ea223a65aa24ed91e61509258f67edf1a22d87f6ed4f53","observation_id":"5e7a3403-0106-478d-8d6b-7b702b6c751a","resolution":{"observed_at":"2026-08-08T16:25:12.444748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.431156Z","title":"Hierarchical dynamic filtering network for RGB-D salient object detection,","venue":null,"work_id":"426d0572-e48f-41bc-95bd-85d0f71a2fac","year":2020},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.637613Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:95ad2000d91bdc21670b175254c4ecb1c562bfe1716a32d0934f3e29c2a1907e","observation_id":"6db32450-10ac-4fb0-ae05-43a71579ee85","resolution":{"observed_at":"2026-08-08T16:25:12.434721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-08T16:25:11.641036Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.641036Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:69ec4ff6931cef7f74c912250e81f646abf377f6395ef4bb2e9ad547ac7f7fe2","observation_id":"b20c7e2b-7652-442f-9f53-6a6d261d3ead","resolution":{"observed_at":"2026-08-08T16:25:11.641036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.422215Z","title":"Masked-attention mask Transformer for universal image segmentation,","venue":null,"work_id":"44fba135-f8e7-4887-b494-63a9aa158027","year":2022},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.644572Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:b926a75123de962dd9c22c38c3822b18dc8cd69954cfe6b7c07c348cf84910ab","observation_id":"479ca3c8-3975-4913-a7ba-6477ee6af807","resolution":{"observed_at":"2026-08-08T16:25:12.425344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.413996Z","title":"FaPN: Feature-aligned pyramid network for dense image prediction,","venue":null,"work_id":"bc19f7ab-4834-45d3-9f8c-e84dd4f5ef29","year":2021},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.648012Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:9147fa411e30a3eed84ede378453edf67994ad809dd5f830effec58e8a50a4d2","observation_id":"7b313d33-c069-4134-9c79-f733d8204ca1","resolution":{"observed_at":"2026-08-08T16:25:12.416855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.405091Z","title":"Integrating low-level and semantic features for object consistent segmentation,","venue":null,"work_id":"9d3cdd45-749d-4c54-bb66-1eef164d4541","year":2013},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.651703Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:b1ff6b41caed4e711291e385df39c177baf12e6e63de63648e31b54bc4e1fabe","observation_id":"0e50d385-22d4-44df-9fc3-af21ebf35232","resolution":{"observed_at":"2026-08-08T16:25:12.408688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.395961Z","title":"Swin Transformer: hierarchical vision Transformer using shifted windows,","venue":null,"work_id":"0622322c-5db8-4fa7-a43a-6c198808d54c","year":2021},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.655134Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:c74b814a402036a5a578a2bd8fff9a6546024a8e887ac5a4db44f5937950bcc5","observation_id":"222ace97-5038-44dc-8641-6e1b419ed1ad","resolution":{"observed_at":"2026-08-08T16:25:12.399323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.386776Z","title":"SegFormer: Simple and efficient design for semantic segmentation with Transformers,","venue":null,"work_id":"43bf3768-cb08-4f15-b2a8-f987a3b1328f","year":2021},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.659806Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:885c1dc2f3c03a843e0c6d8b752b87a15a127ffaf09cd233559fbeeda8ef4e3d","observation_id":"fdba2a60-af07-405b-a178-38bf32d17265","resolution":{"observed_at":"2026-08-08T16:25:12.389892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.377767Z","title":"Object-contextual representations for semantic segmen- tation,","venue":null,"work_id":"24b66131-5106-420c-8528-81756da5bd6a","year":2020},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.663228Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:5e65d1c9bd130b48c031b2b57f11c4c3e6230f51e2817cb29b47bc23ee86e197","observation_id":"cf89a2f1-1fea-474f-aa76-79fee7f70df9","resolution":{"observed_at":"2026-08-08T16:25:12.381433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.367627Z","title":"K-Net: Towards unified image segmentation,","venue":null,"work_id":"a0da4a8d-4741-4e9d-bc33-905f17f92ec3","year":2021},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.666832Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:02ee1a794bd913e9d4bc5f0e5fb7291e944cd56dc40ee35fc1c491f499eeacbc","observation_id":"71d41a84-0cb1-429c-87fa-942315d7aeac","resolution":{"observed_at":"2026-08-08T16:25:12.370225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.358603Z","title":"Expectation-maximization attention networks for semantic segmentation,","venue":null,"work_id":"76c06757-7d5c-4390-8d4c-7da81494cd41","year":2019},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.670351Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:547c7170419a01683b289a5558ea21e880145daa19c865c40495565adc222183","observation_id":"dc9e56c8-7376-40b9-93fa-82241d5ed63c","resolution":{"observed_at":"2026-08-08T16:25:12.361250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:25:12.349122Z","title":"RAFT-Stereo: Multilevel recurrent field transforms for stereo matching,","venue":null,"work_id":"955e3939-3bed-4100-a902-c4e63eeed31c","year":2021},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.673329Z"},"links":{"citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:1c9c05278c94dffc59df0a18ae2b92e7e1eca56634e93dcee01b223c5d2b4161","observation_id":"72a014a4-bdca-493f-a341-6517ccf1d32a","resolution":{"observed_at":"2026-08-08T16:25:12.353040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14074","last_updated":"2023-12-21T17:52:12Z","snapshot_observed_at":"2026-07-06T17:06:41.478216Z","submitted_at":"2023-12-21T17:52:12Z","title":"LiDAR-LLM: Exploring the Potential of Large Language Models for 3D LiDAR Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14074","snapshot_observed_at":"2026-08-08T16:25:11.676998Z","title":"Lidar-LLM: Exploring the potential of large language models for 3D lidar understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.676998Z"},"links":{"cited_paper":"/paper/2312.14074","citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:45c54d2ea4cda26ccba28a680e7973f7a2f107394bd9581b05d2056e56d37133","observation_id":"f873526a-e012-4150-8e36-5dbeb3a814ea","resolution":{"observed_at":"2026-08-08T16:25:11.676998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14150","last_updated":"2025-01-16T10:57:44Z","snapshot_observed_at":"2026-07-06T17:06:45.522731Z","submitted_at":"2023-12-21T18:59:12Z","title":"DriveLM: Driving with Graph Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14150","snapshot_observed_at":"2026-08-08T16:25:11.684696Z","title":"Available: https://arxiv.org/abs/2312.14150","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T16:25:11.684696Z"},"links":{"cited_paper":"/paper/2312.14150","citing_paper":"/paper/2502.06219"},"observation_digest":"sha256:370820eebe44eccd08caa76737416514427a5ec5caa2c78bc5bb3d1f771c298b","observation_id":"7d0502a5-f37c-493f-9e56-04f9354ee14c","resolution":{"observed_at":"2026-08-08T16:25:11.684696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06219","last_updated":"2025-02-10T07:50:22Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T14:39:37.174294Z","submitted_at":"2025-02-10T07:50:22Z","title":"Fully Exploiting Vision Foundation Model's Profound Prior Knowledge for Generalizable RGB-Depth Driving Scene Parsing"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":3,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":52},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 0 inbound Pith citation observations for arXiv:2502.06219."}