{"as_of":"2026-08-16T00:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9866a1ca63f5b968085acd3a7419cd89c13c450df673c76b58e881f7b2562f17","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:57:10.303017Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.10408/citation-record","integrity":"/paper/2509.10408/integrity","json":"/paper/2509.10408/citation-record.json","paper":"/paper/2509.10408"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-04T17:57:10.186207Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.186207Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:96d16e8e1399d308768e47f36fcf51dff1dfe6ca06f0893e0d6c987a159a2d93","observation_id":"7a347fee-22db-4bd8-9b08-f49160e3a192","resolution":{"observed_at":"2026-08-04T17:57:10.186207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.189960Z","title":"Muses: The multi- sensor semantic perception dataset for driving un- der uncertainty","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.189960Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:1c3d43d967321cc598c77baf753b66ac94ef273273ff320d969b53646040cfc0","observation_id":"321ea4a8-aa7b-4ba6-a1fc-0a6ff5d5630d","resolution":{"observed_at":"2026-08-04T17:57:10.189960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.192428Z","title":"Cafuser: Condition-aware mul- timodal fusion for robust semantic perception of driving scenes.IEEE Robotics and Automation Letters, 10(4):3134–3141, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.192428Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:40a8b1a1799ad4521b53480d52b082d7eeb2dec9514f70c1b2df24a094578c65","observation_id":"8d2299ab-02ac-4355-99ef-1496ca893c8b","resolution":{"observed_at":"2026-08-04T17:57:10.192428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.195041Z","title":"Collaborative compensative trans- former network for salient object detection.Pattern Recognition, 154:110600, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.195041Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:26da5af5f71e9ab6d34b832ab4e5573fa362a5df46073530c57d127a6aac423d","observation_id":"b26ff9ed-ab65-4d90-8eec-76772bcc0518","resolution":{"observed_at":"2026-08-04T17:57:10.195041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04579","last_updated":"2024-08-10T11:20:52Z","snapshot_observed_at":"2026-08-12T23:06:26.489341Z","submitted_at":"2024-08-08T16:40:15Z","title":"SAM2-Adapter: Evaluating & Adapting Segment Anything 2 in Downstream Tasks: Camouflage, Shadow, Medical Image Segmentation, and More","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04579","snapshot_observed_at":"2026-08-04T17:57:10.197542Z","title":"Sam2-adapter: Evaluating & adapting segment anything 2 in downstream tasks: Camouflage, shadow, medi- cal image segmentation, and more.arXiv preprint arXiv:2408.04579, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.197542Z"},"links":{"cited_paper":"/paper/2408.04579","citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:21aa0b9737c07dfe7168159443dacceeeba21e352fa83a2484e84911544e3cb0","observation_id":"10b016f4-dd05-416a-99f8-cfe7d4c2ed01","resolution":{"observed_at":"2026-08-04T17:57:10.197542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.200744Z","title":"Sam- adapter: Adapting segment anything in underper- formed scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.200744Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:e7e724b02bb5461af068ca41156abd6535cc0bdd7ca2f1e8dde735c85f529832","observation_id":"ef1c3248-cc62-4eb5-ae67-4aa45eceb3e0","resolution":{"observed_at":"2026-08-04T17:57:10.200744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.203558Z","title":"Vision transformer adapter for dense predictions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.203558Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:93d7019ce6ee7d73104d54daf15058bc2f7d59df3a79db925b2eb9c47fd42b59","observation_id":"2161ec4c-33da-43f1-80c4-97cd035e5390","resolution":{"observed_at":"2026-08-04T17:57:10.203558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.205891Z","title":"Segment any event streams via weighted adaptation of piv- otal tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.205891Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:2ac7786516e0afce67f00dfc3344bd7ecbf2f1df75cff37537d147308b904a40","observation_id":"ffbe9424-33be-486b-b66e-6f15318b9758","resolution":{"observed_at":"2026-08-04T17:57:10.205891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.208028Z","title":"Schwing, Alexander Kirillov, and Rohit Girdhar","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.208028Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:8bd0bbfb928c409a1b8387b97975f04466036598950f1ef6e0cc42cf9b0bb3ec","observation_id":"8c9c4d75-18c7-40d4-a1c8-5299140f9a16","resolution":{"observed_at":"2026-08-04T17:57:10.208028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.210287Z","title":"Schwing, and Alexander Kirillov","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.210287Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:ddde1b414216731ba8a98394213b8295f3e9146ae6e0ec35d301c177e2c44acd","observation_id":"9587c8bd-cda9-4193-b365-0ce82db1a7d1","resolution":{"observed_at":"2026-08-04T17:57:10.210287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.212417Z","title":"The cityscapes dataset for semantic urban scene understanding.2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pages 3213–3223, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.212417Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:5921beba746d603981f2b08ef78170bfb1bf199d4b9524d67b44b1618ad3c7df","observation_id":"4ff29033-4b1c-49c1-bb6b-7118102e7bfe","resolution":{"observed_at":"2026-08-04T17:57:10.212417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1301.3572","last_updated":"2013-03-14T18:18:17Z","snapshot_observed_at":"2026-08-15T00:32:29.873840Z","submitted_at":"2013-01-16T03:31:30Z","title":"Indoor Semantic Segmentation using depth information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1301.3572","snapshot_observed_at":"2026-08-04T17:57:10.214744Z","title":"Indoor semantic seg- mentation using depth information.arXiv preprint arXiv:1301.3572, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.214744Z"},"links":{"cited_paper":"/paper/1301.3572","citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:f2b905beb47e4e9f697f9c88d2657ae0ddb53da5181735d8a0534b81df7fa194","observation_id":"6e0a3a0e-2d4f-4290-9ec7-9f7e61785b99","resolution":{"observed_at":"2026-08-04T17:57:10.214744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.217238Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.217238Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:43c7d5bbdc648789f26de85ff536cfa150a4e14376956bcff9258d6fc83cba0c","observation_id":"14aa2558-9aad-4a5a-b0b4-4da990cd9c00","resolution":{"observed_at":"2026-08-04T17:57:10.217238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00360","last_updated":"2023-12-04T04:38:17Z","snapshot_observed_at":"2026-08-14T07:04:46.646405Z","submitted_at":"2023-12-01T05:50:44Z","title":"Efficient Multimodal Semantic Segmentation via Dual-Prompt Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00360","snapshot_observed_at":"2026-08-04T17:57:10.219394Z","title":"Efficient multimodal semantic segmentation via dual-prompt learning.arXiv preprint arXiv:2312.00360, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.219394Z"},"links":{"cited_paper":"/paper/2312.00360","citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:4afa802839d8a55dd1100fc333aa3fe1c5c5d8ba1b686d162003fb9a5ab2982e","observation_id":"afa845c1-4515-4aef-a7e1-0fb2a2eac19c","resolution":{"observed_at":"2026-08-04T17:57:10.219394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.221729Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.221729Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:d9bbc81ea4ce2d573cbbb6b348e95e2ea71a90d0d7ae25ee9e7a4520616e470b","observation_id":"24009656-2c0f-42c1-ae18-1aaeb7b35a1e","resolution":{"observed_at":"2026-08-04T17:57:10.221729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.223935Z","title":"Mfnet: Towards real-time semantic segmentation for au- tonomous vehicles with multi-spectral scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.223935Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:c371d016548460ee6a8060d26dcabbaf92193e2b4aa238b88a9db37049c9302e","observation_id":"d4ffa69b-a290-4283-8e8a-afb9eea561ea","resolution":{"observed_at":"2026-08-04T17:57:10.223935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.226067Z","title":"A survey on instance segmentation: state of the art","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.226067Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:3af407df9ec9fa594cbacf56c419887a38e1685ed942fdcc020c540970eb6c30","observation_id":"5af5a4f5-2dd9-4ee7-9551-fc2f0b2ac079","resolution":{"observed_at":"2026-08-04T17:57:10.226067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.228255Z","title":"Fusenet: Incorporating depth into semantic segmentation via fusion-based cnn architecture","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.228255Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:c38735f53c56737fe3140251d4eb13f1b7cb7bfb7b8568eece47e5904c9429cb","observation_id":"6e8a6288-2c2d-4e71-9f30-7910b71dabe2","resolution":{"observed_at":"2026-08-04T17:57:10.228255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.230271Z","title":"Masked au- toencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.230271Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:ddb50de3e505d6e12d56a7198c1a4f0ff9473c107a78086a8962293067203e9a","observation_id":"01bcface-043d-41b7-b0fa-1fc4fa44f862","resolution":{"observed_at":"2026-08-04T17:57:10.230271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.232394Z","title":"Parameter-efficient transfer learning for NLP","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.232394Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:64e76ad0026b358e655b9d5485c506b75511a109c169a4f80b06313e8fd83030","observation_id":"5b6c5c2f-fa9d-4b74-8902-b85958b2699d","resolution":{"observed_at":"2026-08-04T17:57:10.232394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.234871Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.234871Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:48aec53c58067ef2def64e6275089e5617f38e3cbf9e4ac688c68f0879f26d90","observation_id":"7805319b-164c-4085-8c3d-e8adddebd491","resolution":{"observed_at":"2026-08-04T17:57:10.234871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.237025Z","title":"Roadformer+: Delivering rgb-x scene parsing through scale-aware information decou- pling and advanced heterogeneous feature fusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.237025Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:dad86413531da243149a6715aeb0e9e3821404c8616444103a1b5966edd6a634","observation_id":"8f1a1af5-46f5-4160-aba9-c778f5cca0ee","resolution":{"observed_at":"2026-08-04T17:57:10.237025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.239078Z","title":"OneFormer: One Transformer to Rule Universal Image Segmenta- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.239078Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:026e517eca70853e7cd959f37279edd88b9da8fa54961a5edb4326b9ffa77f11","observation_id":"c52c5a3c-426e-4b1d-a1b9-785491ca7b29","resolution":{"observed_at":"2026-08-04T17:57:10.239078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.241304Z","title":"Gemini- Fusion: Efficient pixel-wise multimodal fusion for vision transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.241304Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:6e08958ef7f18b1ce1ff0e87e18258fc50e1749931df2b63a109a07e8e242549","observation_id":"dbb802b1-44af-4d7a-b472-6ac5f4943948","resolution":{"observed_at":"2026-08-04T17:57:10.241304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.243502Z","title":"Attention enhanced machine instinctive vision with human-inspired saliency detection.Image and Vision Computing, 152:105308, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.243502Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:e1a30965b47009133c2728fe189aeb0976c347db05d966324e4f7e5113c7974b","observation_id":"c63e47d3-4580-448f-b9bb-c545acac4d55","resolution":{"observed_at":"2026-08-04T17:57:10.243502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.245592Z","title":"Berg, Wan-Yen Lo, Piotr Dollar, and Ross Gir- shick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.245592Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:eb2a030f9b1a45e5147a7097d74ca9f7dddbae3490d877ed7a1fa7f81f0a9b82","observation_id":"13a48c4b-9b69-475e-b3fb-cf79660adc78","resolution":{"observed_at":"2026-08-04T17:57:10.245592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01343","last_updated":"2025-08-07T03:50:19Z","snapshot_observed_at":"2026-08-12T23:09:31.988677Z","submitted_at":"2024-08-02T15:41:16Z","title":"StitchFusion: Weaving Any Visual Modalities to Enhance Multimodal Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01343","snapshot_observed_at":"2026-08-04T17:57:10.247701Z","title":"Stitchfusion: Weaving any vi- sual modalities to enhance multimodal semantic segmentation.arXiv preprint arXiv:2408.01343, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.247701Z"},"links":{"cited_paper":"/paper/2408.01343","citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:22e59ecf9951dbf4d6ec4b1e3b448cb359869bb089bb7beabd37767e9b2fded0","observation_id":"bff41114-5f22-4ec9-bd92-f5d60a20d825","resolution":{"observed_at":"2026-08-04T17:57:10.247701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.250484Z","title":"Roadformer: Duplex transformer for rgb-normal semantic road scene parsing.IEEE Transactions on Intelligent Vehicles, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.250484Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:5da1538b71094ab4fb5cd1eacb02c36d5fbb1cba6571444b82da05d864cd7bf8","observation_id":"10295fea-fd74-43cf-9b98-a0bfe513a6f1","resolution":{"observed_at":"2026-08-04T17:57:10.250484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.252838Z","title":"Multi-interactive feature learning and a full- time multi-modality benchmark for image fusion and segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.252838Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:8395dec9f2ce92cfcdcd956807e61e806467ba611011df1a5a25ee0cee26cfad","observation_id":"5287e19c-3f4c-42aa-8e6d-c9397b8c784e","resolution":{"observed_at":"2026-08-04T17:57:10.252838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.255063Z","title":"Segmenting anything in the dark via depth perception.IEEE Transactions on Multime- dia, pages 1–12, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.255063Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:380b1a9f7c448ca617a6a18435a86b583fbc644d3972adacfef02f69b8e6184b","observation_id":"2ffc6ece-79bf-48fd-a552-5ceb07405b8e","resolution":{"observed_at":"2026-08-04T17:57:10.255063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.257218Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.257218Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:6921235fe0a1e140df9f87c0d58ef0f546e2a856073ae8c621f6ceee0ae61602","observation_id":"c5fea37f-8238-43df-aa41-f3988d9643af","resolution":{"observed_at":"2026-08-04T17:57:10.257218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.259399Z","title":"A convnet for the 2020s.Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.259399Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:f20906d29e762c15ddbc224821c32afefe6dc7afbccdcecac2d186957b1db1ea","observation_id":"5992e257-fcb6-49f8-8eb5-100c7c6567e3","resolution":{"observed_at":"2026-08-04T17:57:10.259399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.261526Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.261526Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:2f0f9a0200a734ed53dcd98cb046e22ab9fec1f251236122b538da134007e183","observation_id":"c126f55d-efe6-4849-b253-45b5d7c9c018","resolution":{"observed_at":"2026-08-04T17:57:10.261526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.263645Z","title":"Image segmentation using deep learn- ing: A survey.IEEE transactions on pattern anal- ysis and machine intelligence, 44(7):3523–3542, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.263645Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:1206d91cd539c6499459849ba69d41b99cf0a02f40968f93df285291d950ed99","observation_id":"2d1f97ab-94f3-4564-848e-9ba6dcd619ad","resolution":{"observed_at":"2026-08-04T17:57:10.263645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.265986Z","title":"SAM 2: Segment any- thing in images and videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.265986Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:87efaf78485295cf570adebba08cc030110ff5e6505f98bbb597c20ca05df204","observation_id":"f9264136-54ee-45f1-a977-77d6d5f7c882","resolution":{"observed_at":"2026-08-04T17:57:10.265986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17803","last_updated":"2024-07-29T08:43:48Z","snapshot_observed_at":"2026-08-13T04:30:14.328412Z","submitted_at":"2024-01-31T12:53:11Z","title":"SU-SAM: A Simple Unified Framework for Adapting Segment Anything Model in Underperformed Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17803","snapshot_observed_at":"2026-08-04T17:57:10.268219Z","title":"Su-sam: A simple unified framework for adapting segment anything model in underperformed scenes.arXiv preprint arXiv:2401.17803, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.268219Z"},"links":{"cited_paper":"/paper/2401.17803","citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:b7bd1548f04681b8ee715b5c6deebca55eb08e9b4f3b82a5404e1fab688b828f","observation_id":"32733f63-bd37-4c62-b959-6b3275abae41","resolution":{"observed_at":"2026-08-04T17:57:10.268219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.270722Z","title":"Rtfnet: Rgb-thermal fusion network for semantic segmen- tation of urban scenes.IEEE Robotics and Au- tomation Letters, 4(3):2576–2583, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.270722Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:f4d3d300f85111c503484433cca183c14125a05d4371fa19db166862f2a991c7","observation_id":"fc436ae8-5d0b-4d19-bcaf-486117b5da63","resolution":{"observed_at":"2026-08-04T17:57:10.270722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.272981Z","title":"Semantic segmentation using vision transformers: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.272981Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:ef45d97bdd1d48c6e0f820298f6a20d8be2b7e17bdac77c12a250a2e91433645","observation_id":"230a0912-8149-4038-a4b9-d6d09373d600","resolution":{"observed_at":"2026-08-04T17:57:10.272981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15063","last_updated":"2024-11-12T14:29:09Z","snapshot_observed_at":"2026-08-12T22:56:36.657774Z","submitted_at":"2024-08-27T13:47:31Z","title":"Adapting Segment Anything Model to Multi-modal Salient Object Detection with Semantic Feature Fusion Guidance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15063","snapshot_observed_at":"2026-08-04T17:57:10.275121Z","title":"Adapting seg- ment anything model to multi-modal salient object detection with semantic feature fusion guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.275121Z"},"links":{"cited_paper":"/paper/2408.15063","citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:5579fcb6c1186782ed8d9b60793a2c4d6b4f28014cebb71a5f8252f0984a4c87","observation_id":"2082cd3f-be90-465e-84f5-8346df53bdd3","resolution":{"observed_at":"2026-08-04T17:57:10.275121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.277486Z","title":"Multi- modal token fusion for vision transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.277486Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:f642db67865922557bf133cd9de249388be6fa4720d7c866662442ee430e1ddc","observation_id":"834e7e1b-6041-4db0-a64c-9c8b88137669","resolution":{"observed_at":"2026-08-04T17:57:10.277486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12620","last_updated":"2023-12-29T03:40:59Z","snapshot_observed_at":"2026-08-15T13:11:26.618780Z","submitted_at":"2023-04-25T07:34:22Z","title":"Medical SAM Adapter: Adapting Segment Anything Model for Medical Image Segmentation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12620","snapshot_observed_at":"2026-08-04T17:57:10.279609Z","title":"Medical sam adapter: Adapting segment anything model for medical image segmentation.arXiv preprint arXiv:2304.12620, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.279609Z"},"links":{"cited_paper":"/paper/2304.12620","citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:10b6aee8c4c0ee22ccc4d46492a0cf105a2fbbce5cde7c8e9bcdc203a745b719","observation_id":"e11ff524-d44d-4b46-b372-17654bd44545","resolution":{"observed_at":"2026-08-04T17:57:10.279609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09085","last_updated":"2024-08-17T03:45:40Z","snapshot_observed_at":"2026-08-12T23:02:21.120108Z","submitted_at":"2024-08-17T03:45:40Z","title":"Segment Anything with Multiple Modalities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09085","snapshot_observed_at":"2026-08-04T17:57:10.281980Z","title":"Segment any- thing with multiple modalities.arXiv preprint arXiv:2408.09085, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.281980Z"},"links":{"cited_paper":"/paper/2408.09085","citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:3e94b11a8a5ecfd25a0915764622c43f9cfe2180e6c6782bede2f15cc4765e08","observation_id":"0679f528-db9c-4605-b29c-069c9e0a19ba","resolution":{"observed_at":"2026-08-04T17:57:10.281980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.284408Z","title":"Seg- former: Simple and efficient design for semantic segmentation with transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.284408Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:08409874f40c1cae0d17d6dab2b17b64dbf4081521014a0cb2fa78a466a16be7","observation_id":"56391f36-4c52-4d92-a294-5cfd60b7218b","resolution":{"observed_at":"2026-08-04T17:57:10.284408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.287014Z","title":"Parameter-efficient fine-tuning for pre- trained vision models: A survey.arXiv preprint arXiv:2402.02242, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.287014Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:fae8c08fac4514133601b334b4257ca549f8978f4bc3fcc4ccaef0f70cd4a6d4","observation_id":"22e54170-aa7d-43a2-9e10-e363942b4729","resolution":{"observed_at":"2026-08-04T17:57:10.287014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.289144Z","title":"Sam-event-adapter: Adapting segment anything model for event-rgb se- mantic segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.289144Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:56eecffd89817455cf089e1ce8e8e57e6d79cd9fb3072c064729d78f762bb3dc","observation_id":"e72d7695-c7bd-40df-9a41-d37a777a0e66","resolution":{"observed_at":"2026-08-04T17:57:10.289144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.291313Z","title":"Zeiler, Dilip Krishnan, Geoffrey W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.291313Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:cc66ce1eda7b17132c3acdcbac3eda5a8923abfde43a262f667ff5cea1b5ef90","observation_id":"e7fa07fc-aeb5-4860-ae5d-b375f634f202","resolution":{"observed_at":"2026-08-04T17:57:10.291313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.294088Z","title":"Cmx: Cross-modal fusion for rgb-x semantic segmen- tation with transformers.IEEE Transactions on Intelligent Transportation Systems, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.294088Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:6f7645dc6048af4352d0b3aebeed15b2b90775a9aa2a53721e8e4b7f632f4942","observation_id":"9a39c179-554c-4663-8330-f54d22db7bae","resolution":{"observed_at":"2026-08-04T17:57:10.294088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.296256Z","title":"Delivering arbitrary-modal semantic segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.296256Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:fa0db88e03e93b63d7182aa67f7265039dc2ea4f5915d517d8cafd69ca1fd914","observation_id":"1a73dad3-2c41-4073-afdc-9abc20864828","resolution":{"observed_at":"2026-08-04T17:57:10.296256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.298400Z","title":"Deep multimodal fusion for semantic image segmentation: A survey.Image and Vision Computing, 105:104042, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.298400Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:818860a1dc086f14bd9af368a9518bd61ef931533f59ba7712b39e9d94fe4932","observation_id":"749ab53f-542a-47d8-a558-4616d11995ab","resolution":{"observed_at":"2026-08-04T17:57:10.298400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.300803Z","title":"Deformable{detr}: Deformable transformers for end-to-end object de- tection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.300803Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:da8effdb6eb6b245d57ff30d63abf715a35a3903987a03b20ecbfffd26a0b8da","observation_id":"4b1635b9-56b0-4d54-be00-68dd0d04c5c0","resolution":{"observed_at":"2026-08-04T17:57:10.300803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.303017Z","title":"Segment everything every- where all at once.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.303017Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:5f251ec0e11f4df4ccd357be316fcc8eae70f99bcaeb5fc296603d865e6e7d3e","observation_id":"77138987-85c1-44ac-9295-184ca60b8ac8","resolution":{"observed_at":"2026-08-04T17:57:10.303017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T01:57:55.616419Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2509.10408."}