{"as_of":"2026-08-09T14:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a8b3260cbb1dccd0c5fab7df2a2e401173761146163759c689cd39009ca8239","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T02:44:21.812343Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.09481/citation-record","integrity":"/paper/2607.09481/integrity","json":"/paper/2607.09481/citation-record.json","paper":"/paper/2607.09481"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"BiomedParse-V: Scaling foundation model for universal text-guided volumetric biomedical image segmentation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:f31c4e83b44ff5534c38d7915f5691093478fef37a44e69f2da2cf182334c2dc","observation_id":"bc438ef5-c596-4620-8d0c-f3abc88777b0","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"U-Net: Convolutional net- works for biomedical image segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:8cd4617815bb6fee45b6843d1fa8bd6672891e337520aa3e159a7bd81918167d","observation_id":"b5ffb46a-9610-4aed-b186-d828cb13926c","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"nnU-Net: a self-configuring method for deep learning-based biomedical image segmentation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:7b479c6b2d90a39e26103ba0b561da42e25f4d113be4f2d941668f20dd2f844d","observation_id":"875b6e9e-99b7-49ae-9129-1d5c1e192747","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"UCTransNet: rethinking the skip connections in U-Net from a channel-wise perspective with transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:434e018fde09fb50c1a6ccbe529189c3a34e2249e69887213bd5e12749e0eb24","observation_id":"4ddfc3be-475c-4e5f-9945-4d60e4a1e830","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"LViT: Language meets vision transformer in medical image segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:08b0ce21c7c24c8cfa66da2fa2d25aa6c1e4e101e38cb439c33c7b22b06ef647","observation_id":"a25034c8-ffff-4922-ae90-0b5aedbd6b05","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"Ariadne’s thread: Using text prompts to improve segmentation of infected areas from chest X-ray images,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:8ec49da598c0c43cbf828540f1df92b59181e7a9d86eb5a972935be3896863b4","observation_id":"5b287eff-ec43-452f-9aa3-541e3bc1cf85","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"DuSSS: dual semantic similarity-supervised vision-language model for semi-supervised medi- cal image segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:44c02b32564467a1072c33d30e26e223f470aa172cb98d9d96c4ac057747edba","observation_id":"f0577f7e-39c4-4b88-840d-659bd79eb1a2","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"Harnessing text insights with visual alignment for medical image segmentation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:85c0cdd0c84c2d60e25d16a90cbde5a33e42361b137f7026b033850c1b0bc6fe","observation_id":"a3be5972-5dab-417a-a079-46aadd2d6c48","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"TGS-LGP: Text-guided medical image segmentation via local-global perception,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:f553ec5e4b46b4a0e1245563d3cf4fa4eb0538e1843dbe349341d613540ac365","observation_id":"d4921083-2cfd-46ec-a72d-8bf330b54a84","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:1b580a497bf3053c9cf69f2f5eba3b7a18df555a475b7ab6d08f24cf0ffaf0d4","observation_id":"9e302b4a-2dca-4c78-8e1b-d20b84fee8d8","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"SAM- Adapter: Adapting segment anything in underperformed scenes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:18ab21d8ad704c72f3531b8916765a3f67b3dc50daef90a76533dc5d44b95619","observation_id":"452842f7-a7e0-45ee-904d-5e76c3e22539","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"Segment anything in medical images,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:994bb96ca3a0b5a1888feede9db0bfcbfef00887f79a9a0c619c43aec3bd5c9c","observation_id":"03b7e64d-b888-43d7-ae18-99f2d6ca4307","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"SAM 3: Segment anything with concepts,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:61709dc40eacc09459a4431267f6f58467d4d459bf167c21dba4276ccaa1db8c","observation_id":"d59b49a0-040a-4948-b033-ca8ac2db5b3a","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"Gloria: A multimodal global-local representation learning framework for label- efficient medical image recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:ceac2bf77734b923d9af277901d27ddf9e8b9f3a6936ca7232ebb912eda0b7d2","observation_id":"b4fb145b-944f-4214-ab7e-4ede346df877","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"TGANet: Text-guided attention for improved polyp segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:000bbbf1e4819cd7618a50dde44a32adf117b0b6c32500c5e946920195fde47f","observation_id":"aefa5b16-4b8a-49aa-8d93-e3dee10b8730","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"Text-guided cross-position attention for segmentation: Case of medical image,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:3af7a7fe1f7569de11c23ac18f296d592710ef9479e6f5462a77260e6fdd12a0","observation_id":"e7fdba59-b59e-470d-b135-f26957fde633","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"Common vision-language attention for text-guided medical image segmentation of pneumonia,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:f1253c5067b14813bb2c28ab8c4545fec55c30543c7b2d709250e5dd2ec7cf17","observation_id":"2803b427-e6bc-49c4-9ac2-9d95c568b561","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"Frequency- domain multi-modal fusion for language-guided medical image segmen- tation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:33521ae265d69445837ce65a1f8381aa5f6ee1e118d83adf1a599acc0ff7b385","observation_id":"bb31a07f-e572-41a9-8ac4-4384525a5a1a","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"Bi-VLGM: Bi-level class-severity- aware vision-language graph matching for text guided medical image segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:4dd47c4e00c5a864694012d99f87259cb6aa60c720f013b5d98d4ea7a6cbfce5","observation_id":"5fc763b3-4094-4963-b32e-83692abbd300","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"LGA: A language guide adapter for advancing the SAM model’s capabilities in medical image segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:59cbfe5b7c119a954fc776c3fc95e724eb8c667e616825b1c7bab3a3f20c4663","observation_id":"df6530c3-e939-4551-95e2-22673d4b1a1b","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"Learning to exploit temporal structure for biomedical vision- language processing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:54b4244c631b15b65d9d1d542da054489fc3eb849ab25f0d6101571744074636","observation_id":"d1fbfb29-e4ea-49a5-8628-e1bc3f8ec206","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"Publicly available clinical BERT embeddings,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:c1135209d841e0fe5b86139ed588db6767d5f2d93236b7ae1a494bbed5b6b049","observation_id":"9890cff9-c5f5-40d4-bb34-621505573d09","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"A visual–language foundation model for pathology image analysis using medical Twitter,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:9ba5dc4dba83b4528d9a0617fcdc3214f0b0b68af8bbce8ee2d5f5e4f1ce5546","observation_id":"c34ec7f9-d705-4ffa-83c9-4796ae7a7556","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"G2D: From global to dense radiography representation learning via vision- language pre-training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:3f94afdd231288fbec69e13c9afb2e9a3a5332345da7c10406c414bbd9215fb8","observation_id":"69f5c113-9d4b-4cf0-a6c2-e41c1dbdbb70","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"EviVLM: When evidential learning meets vision language model for medical image segmentation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:b7f22ef28b05ea297349dfe862780d5bc26b286af0643b650ab1cfe26b2420c3","observation_id":"d861d9c0-84b0-4bb7-ad0b-40c9cbeaedc9","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"MedKLIP: Medical knowledge enhanced language-image pre-training for x-ray diagnosis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:46bd92d00dfeb5983a5b8cf6fa460e1cc47846775841d6a4b9b9b70545a2b9ff","observation_id":"aa1d62a0-49f5-40e0-aec1-08330c55efb9","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"CXR- CLIP: Toward large scale chest x-ray language-image pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:c62506b09698569a5bafabe04f8a8f8b6810bb4a6f7e0ab13b845a7fcb298cb1","observation_id":"6ffcd9fc-2b3d-4dff-9abd-3ea5ea598b1a","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"A ConvNet for the 2020s,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:d4f47ab0c056641991f66b73b1fa029c22c15a14ffd114fd9c29beea3cb97c21","observation_id":"c9d1f0ff-8b2c-48ce-81c8-ec07a02aea1b","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"Making the most of text semantics to improve biomedical vision–language processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:3bf16a0675650dab122cdf36f700f9d8993877e5a5ea620a216c8d9005aa7bee","observation_id":"86d9a08e-95ab-42c0-aa58-0d15b2e58849","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"UNETR: Transformers for 3d medical image segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:71c92c81ecadf335522a92ecdcb8a3adb4786fe0db5008cd928da743aecacb66","observation_id":"d06b8275-7189-4ce4-82e5-e88a4225377f","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:8c8bc36188ea71265324618efb63a3434ed23dbc5ff525329f5e43423696a257","observation_id":"08efefa5-f31f-42b7-b606-b2efb8f45d2a","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.06465","last_updated":"2020-05-13T13:04:37Z","snapshot_observed_at":"2026-08-04T06:53:47.606776Z","submitted_at":"2020-05-13T13:04:37Z","title":"MosMedData: Chest CT Scans With COVID-19 Related Findings Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.06465","snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"MosMedData: Chest CT scans with COVID-19 related findings dataset,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"cited_paper":"/paper/2005.06465","citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:ab6317a7de3182c4bc804dad5c1da66fb20690d53fa98f3123130919faf4fa50","observation_id":"fbdad86f-435b-4c1d-833f-1483d0390aba","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"OSegNet: Operational segmentation network for COVID-19 detection using chest x-ray images,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:6585b90706622f219b5093ea7feca19401e3f172157a9e08e544d470513545d8","observation_id":"7f75b96a-261c-4f48-ab30-dfcc3e0de57c","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"SIIM-ACR pneumothorax segmentation 2019,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:7f154039cc3790ce8b367ee3076176bf425f05a55d4a1b06c18caf48e844ba74","observation_id":"640a594c-8061-49fb-a62a-823295e9f5c9","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"Kvasir-seg: A segmented polyp dataset,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:594e1f7a1eb5144919d697b8652d0ebb7e11b3485d1b158d3f13e5cf2517f331","observation_id":"20127ba5-9602-4990-98f4-5ecfcc762534","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"Swin Transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:81908daf8c296b1cf509ac9b9bd7ce1f94c11970f7ff53b5d13d425d6ec1771a","observation_id":"cac3f59e-6a67-4092-81c2-cb7294c3a37a","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"Training data-efficient image transformers & distillation through attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:3cde95fc523fe239a0545ad3058500237bbd03820d22bdb91f01c45c39c973b4","observation_id":"108a60b7-34f5-4bf5-a0b4-20ffbe7cb298","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:bd4686a4817ce4d31cc15ad8f0a21e90a49e3aeec35b879446d823365f2a4ddb","observation_id":"02fe4d5d-5cf0-44d5-87ac-66da6a554d2f","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"MultiResUNet: Rethinking the U-Net architecture for multimodal biomedical image segmentation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:301fb3843ca0414d8e156b1c32a218378334396d9e69b823c57a98b777fdf60c","observation_id":"88ef9bf6-9bcf-4654-98a0-5cb207c7d392","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"Swin- Unet: Unet-like pure transformer for medical image segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:62c450e9cd2e2315ddb860f82671895365dc2bb36f715d1dd356939c0df56c9d","observation_id":"1a93ae88-503c-43f6-8db6-e60156a78fb1","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16184","last_updated":"2023-08-30T17:59:02Z","snapshot_observed_at":"2026-07-06T16:12:26.218372Z","submitted_at":"2023-08-30T17:59:02Z","title":"SAM-Med2D","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16184","snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"SAM-Med2D,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"cited_paper":"/paper/2308.16184","citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:ad9200e473fb43b9867c68b4ccd6cbd0e18c951f119558a95176f0c2faaec728","observation_id":"d84bb43b-3b59-4787-a2b3-4dffc416a432","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T02:44:21.812343Z","title":"Cross- modal conditioned reconstruction for language-guided medical image segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T02:44:21.812343Z"},"links":{"citing_paper":"/paper/2607.09481"},"observation_digest":"sha256:b5a63ad2cf50ba0bcd678272a263568aaf43122227d22a9ce5ff39566dedbf6d","observation_id":"f7bf46a3-72c1-42ea-a827-df1d6bb0ce4c","resolution":{"observed_at":"2026-07-13T02:44:21.812343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.09481","last_updated":"2026-07-10T14:57:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:16:15.149041Z","submitted_at":"2026-07-10T14:57:36Z","title":"Decoupling Language Guidance from Backbones for Text-Guided Medical Segmentation"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2607.09481."}