{"as_of":"2026-08-10T11:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d55a229cf464b5cae29461e6a0eebe90763e58f7f4625360b6062424393d1aa5","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T03:33:58.234123Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16327/citation-record","integrity":"/paper/2607.16327/integrity","json":"/paper/2607.16327/citation-record.json","paper":"/paper/2607.16327"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:53.916022Z","title":"Deep learning tech- niques for medical image segmentation: Achievements and challenges,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:53.916022Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:248b753c97cdbaef1ee0f94a46db42e3bd449a6a1b7b1bb4b32c8ef2925aa399","observation_id":"ccb9c877-32eb-4828-97ef-69ea95b821d8","resolution":{"observed_at":"2026-08-02T03:33:53.916022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:53.981044Z","title":"Deep learning for medical image-based cancer diagnosis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:53.981044Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:83cea7c943b134bdc2e03123c3137119eb1235a30a7cff4e3e9e7f32f1cbcfc2","observation_id":"9f4b51bf-a75b-4164-a5a3-69ad9722a9a1","resolution":{"observed_at":"2026-08-02T03:33:53.981044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.047140Z","title":"U-Net: Convolutional net- works for biomedical image segmentation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.047140Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:6a6f8a8cbb47f296e5aa2273843cc22d4b93a7595c07105a43dcdf87b476aae6","observation_id":"ef35072a-6485-45b3-9e25-9aac722185a2","resolution":{"observed_at":"2026-08-02T03:33:54.047140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.112810Z","title":"UNet++: A nested U-Net architecture for medical image segmentation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.112810Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:67fb3917f33c53cdd00d97186c7f46a224b74d738adb769bdf05258fc4c77f96","observation_id":"f3edaa6e-c1ac-43bb-bcdf-6e398ee43691","resolution":{"observed_at":"2026-08-02T03:33:54.112810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03999","last_updated":"2018-05-20T23:33:30Z","snapshot_observed_at":"2026-07-06T06:32:53.966022Z","submitted_at":"2018-04-11T14:13:03Z","title":"Attention U-Net: Learning Where to Look for the Pancreas","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03999","snapshot_observed_at":"2026-08-02T03:33:54.180627Z","title":"Attention U-Net: Learning where to look for the pancreas,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.180627Z"},"links":{"cited_paper":"/paper/1804.03999","citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:5e5e3fdd86b22cd0fa373c12d6d097d4560f3e0751f895ceb8e8dbea656ecd4e","observation_id":"aa6ed495-a631-4050-8767-5aba943efc68","resolution":{"observed_at":"2026-08-02T03:33:54.180627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.242270Z","title":"Swin-Unet: Unet-like pure transformer for medical image segmenta- tion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.242270Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:a94404017d730ebbacd86510beb8d41b8daac8b458beb19f0dc4732c189b17c2","observation_id":"8d064f21-0605-41a8-892d-57e17ba701ac","resolution":{"observed_at":"2026-08-02T03:33:54.242270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.365978Z","title":"nnU-Net: A self-configuring method for deep learning-based biomedical image segmentation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.365978Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:1b523382f335b499799f6dc098221c5ad37b559224339971cd35424cbacefd47","observation_id":"15439499-5e3e-45ba-a7c1-b4277f5f0b7c","resolution":{"observed_at":"2026-08-02T03:33:54.365978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.439157Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.439157Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:05d8b5fa85da525c9e6d25548dd4cc86e3c02bc296dbdc5a2367f4ffd7a5495a","observation_id":"38ec1d6d-3275-4a6a-a9a1-56e768c4a92e","resolution":{"observed_at":"2026-08-02T03:33:54.439157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.512035Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.512035Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:ac661a1617517576b37c0a15e2b395cd38cf09eb8ce4a186f7427f4cfae82126","observation_id":"02f9707a-dcae-4e74-8e70-1ef9c75b5b51","resolution":{"observed_at":"2026-08-02T03:33:54.512035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.580133Z","title":"GLoRIA: A multimodal global-local representation learning framework for label- efficient medical image recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.580133Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:c2828221e104ec0a6678f7eb83c8c9906c34df260d88e9971dbe0b1482d89418","observation_id":"dbf4b19c-e152-4b54-ace1-91f4af370e69","resolution":{"observed_at":"2026-08-02T03:33:54.580133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.806210Z","title":"LViT: Language meets vision transformer in medical image segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.806210Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:50990ada70bb353963d53dec13c308c1b67bef7096d8a780a3528e0f2c2f432e","observation_id":"b2662fa3-f2d8-479b-8e2e-dbc88add48ef","resolution":{"observed_at":"2026-08-02T03:33:54.806210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.906368Z","title":"Ariadne’s thread: Using text prompts to improve segmentation of infected areas from chest x-ray images,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.906368Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:eebfdf6be09fd988994bc7268301ee08f9f0209891fe42edd81a7ae98b9f28c0","observation_id":"4aec5cc1-f463-4c5e-8968-105fcb33c02c","resolution":{"observed_at":"2026-08-02T03:33:54.906368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:54.985092Z","title":"Text-guided cross-position attention for segmentation: Case of medical image,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.985092Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:6fc7fe6edb155c3642c598c531e8264a8a4b5a9a6a9bf46ecb4cacf9749f2f9b","observation_id":"db80b1ee-d729-4e65-818d-9986ad89c2f4","resolution":{"observed_at":"2026-08-02T03:33:54.985092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:55.105671Z","title":"Harnessing text insights with visual alignment for medical image segmentation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.105671Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:b78b4239c89048c5be2b09889181e03eab0ff63d07e721d4a7b75f8fa8d95fef","observation_id":"f49e95bd-2331-41b7-993d-9a4c6ec1c1a0","resolution":{"observed_at":"2026-08-02T03:33:55.105671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:55.187965Z","title":"ViTexNet: Vision-text guided dynamic convolution network for medical image segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.187965Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:a44271b8b41542eeaaabd45809415050c041bb7c3b393cec6ce4d442de7e430f","observation_id":"56682ac8-3629-4413-a5e8-038801929993","resolution":{"observed_at":"2026-08-02T03:33:55.187965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:55.284254Z","title":"Progressive cross-scale semantic alignment for language-guided medical image segmentation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.284254Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:a317254836a81b1cbdcfe5e4f2a9241491075fcc355cf717d27145d167595f9f","observation_id":"33998b4c-a87f-493b-a2b3-de790d01266b","resolution":{"observed_at":"2026-08-02T03:33:55.284254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:55.353745Z","title":"Making the most of text semantics to improve biomedical vision–language processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.353745Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:f253c1d567f035ddba36007f41e3193d4646680ba7e03b7bca49ab14078589f1","observation_id":"617ab67b-7a07-456c-a34b-625a956520de","resolution":{"observed_at":"2026-08-02T03:33:55.353745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:55.420105Z","title":"Multimodal spatial attention module for targeting multimodal PET–CT lung tumor segmen- tation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.420105Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:d3bc61cf44c850c0d51c600cc3e66a86fad249d29adb66aa4346578810956b66","observation_id":"e9c3c2af-d64f-45fe-a7d6-9727eb0a0270","resolution":{"observed_at":"2026-08-02T03:33:55.420105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:55.502601Z","title":"Task-driven image fusion with learnable fusion loss,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.502601Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:e1d0dae3808b55a05a76494bcb484670602a596d1155369affcb922bf96df1b9","observation_id":"aa00e67b-989b-4334-a743-c7adfe12a258","resolution":{"observed_at":"2026-08-02T03:33:55.502601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:55.598863Z","title":"OSegNet: Operational segmentation network for COVID-19 detection using chest X-ray images,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.598863Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:8c01cf260148c055b046bd13f9d203c96cd8a48057140478152a614192a8bd8f","observation_id":"a92034d7-f3ca-4536-bb94-63298b780d41","resolution":{"observed_at":"2026-08-02T03:33:55.598863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:55.836541Z","title":"Kvasir-SEG: A segmented polyp dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.836541Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:8eb1e7ebacf04dfd093290972cb2a28cc1d0ae2ef02552e93d02298bdc822802","observation_id":"1a75f160-6048-47cb-99be-851aadb7109d","resolution":{"observed_at":"2026-08-02T03:33:55.836541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:55.919093Z","title":"MAdapter: A better interaction between image and language for medical image segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.919093Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:45281c82f4ba415e50828c595661f5e04f24ae85d33b9e80b47efd535da96ab9","observation_id":"6714cf34-f41e-4804-81af-825014a6ad85","resolution":{"observed_at":"2026-08-02T03:33:55.919093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.014165Z","title":"Frequency- domain multi-modal fusion for language-guided medical image seg- mentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.014165Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:1f5dd65096ed6574c402b0245f81e9d65d6ce1e3b26839e7afe9cbc377feb2b7","observation_id":"82f41ed1-91fb-4d90-8e37-79dafaade6a2","resolution":{"observed_at":"2026-08-02T03:33:56.014165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.073115Z","title":"EviVLM: When evidential learning meets vision–language model for medical image segmentation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.073115Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:db7a119855ce98bba19b7543804a4159324050cf117833c30f000f6453f38aac","observation_id":"53bf893a-44b0-42fb-87d6-a66358e35aa8","resolution":{"observed_at":"2026-08-02T03:33:56.073115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.155760Z","title":"Cross- modal conditioned reconstruction for language-guided medical image segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.155760Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:8d2991f99e9ee0472c12c8a40a2a67b577a88806393d2d058606e6825f8aa969","observation_id":"5fe58786-1db7-40fb-9af0-b03b4914a82f","resolution":{"observed_at":"2026-08-02T03:33:56.155760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.247291Z","title":"SGSeg: Enabling text- free inference in language-guided segmentation of chest X-rays via self-guidance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.247291Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:bddf61758b7138dcc9ddc06190ac381152e7ba807ac6199e67f18c16de8bc583","observation_id":"3d63d240-409d-4c02-8355-3a0b1ddfb798","resolution":{"observed_at":"2026-08-02T03:33:56.247291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11055","last_updated":"2025-07-19T01:01:24Z","snapshot_observed_at":"2026-08-06T17:15:49.649096Z","submitted_at":"2025-07-15T07:38:49Z","title":"Alleviating Textual Reliance in Medical Language-guided Segmentation via Prototype-driven Semantic Approximation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11055","snapshot_observed_at":"2026-08-02T03:33:56.305981Z","title":"Alleviating textual reliance in medical language-guided segmentation via prototype-driven semantic approximation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.305981Z"},"links":{"cited_paper":"/paper/2507.11055","citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:a2bac9580d477f33ada93bf21d0b235260de38a433831e2aa8ab3e0b136d8481","observation_id":"7f1cce9d-9ea4-4e7e-a777-8206e2317d64","resolution":{"observed_at":"2026-08-02T03:33:56.305981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.402128Z","title":"Cross-aware early fusion with stage- divided vision and language transformer encoders for referring image segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.402128Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:0ba713c09cf5545d9a2625f74aaa07faa5271bf79b01475d6e54ce41acf7c444","observation_id":"184c3eab-c1d6-4fa2-ab81-0c48e4f16be0","resolution":{"observed_at":"2026-08-02T03:33:56.402128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.494122Z","title":"CM- MaskSD: Cross-modality masked self-distillation for referring image segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.494122Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:a844bdc837438672c18ccd6f29ab021b9ab7ec95aaea00479d76d46b1a60789d","observation_id":"87ec8db7-05e9-4acc-8e9c-c32f1eee7932","resolution":{"observed_at":"2026-08-02T03:33:56.494122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.625962Z","title":"Bring adaptive binding prototypes to generalized referring expression segmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.625962Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:23fb5827deab9ac336fab3ad57292b4261ea0c967786acc315e5dbeff09f6539","observation_id":"cf30cb17-a266-4f2b-abeb-20b4128f61f7","resolution":{"observed_at":"2026-08-02T03:33:56.625962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.717708Z","title":"Deep learning-based clas- sification of healthy aging controls, mild cognitive impairment and alzheimer’s disease using fusion of MRI–PET imaging,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.717708Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:ac0d94565420ae9ca34017fc93bb4d3276200f8f5efe4e7ffae2ab105f034dfe","observation_id":"907aec0a-aa79-4011-8747-6a3d8d68b716","resolution":{"observed_at":"2026-08-02T03:33:56.717708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.809615Z","title":"A survey on ensemble learning under the era of deep learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.809615Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:d24fc9cf534d332c1653ebf474083f9cc93188d74eb36e39bd3010a2c2e9613d","observation_id":"24efab2f-d1f3-4f05-8e0e-768675f6c12b","resolution":{"observed_at":"2026-08-02T03:33:56.809615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.898966Z","title":"Advancing multi-modal beam prediction with cross-modal feature enhancement and dynamic 14 fusion mechanism,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.898966Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:c49fcc7aae7b83c382e9cb8d30bb4c93dbd8b3e04978c622a8913058c07e8ee3","observation_id":"1dc01c36-eb4d-433a-8928-dd2b7b2fd2e5","resolution":{"observed_at":"2026-08-02T03:33:56.898966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:56.988194Z","title":"AMFuse: Add-multiply-based cross-modal fusion network for multi-spectral semantic segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:56.988194Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:165be709584c75e7224111c4dd51a28ba90c6d21e9e831e3a8a4aa473351f7b8","observation_id":"5815535d-b1bf-4b44-8748-362f777a837e","resolution":{"observed_at":"2026-08-02T03:33:56.988194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:57.069789Z","title":"ICAFusion: Iterative cross-attention guided feature fusion for multispectral object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.069789Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:005c478fbc9374e661e22c4f1263c4c5c69004bbdfdfc43b2c009469251ed581","observation_id":"cb9b1452-7c5c-4e1b-858c-5715be6c76f8","resolution":{"observed_at":"2026-08-02T03:33:57.069789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:57.191190Z","title":"Pre-gating and contextual attention gate: A new fusion method for multi-modal data tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.191190Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:06df97fcf25d899c973f5602e05905ab6b9e8c585aca3132182b318348e4dcd2","observation_id":"bf6c28a9-0c4b-4105-9f89-ab4300f95cc8","resolution":{"observed_at":"2026-08-02T03:33:57.191190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:57.275790Z","title":"MsgFusion: Medical semantic guided two-branch network for multi- modal brain image fusion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.275790Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:581ac85eeee4d6952de98173dd8fec37f2fdcd4eee05e89040f74196995e9cab","observation_id":"603f0933-8a78-4ddb-9fda-daf18a43b8e6","resolution":{"observed_at":"2026-08-02T03:33:57.275790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23365","last_updated":"2025-05-29T11:42:57Z","snapshot_observed_at":"2026-08-07T22:11:57.320582Z","submitted_at":"2025-05-29T11:42:57Z","title":"MCFNet: A Multimodal Collaborative Fusion Network for Fine-Grained Semantic Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23365","snapshot_observed_at":"2026-08-02T03:33:57.334363Z","title":"MCFNet: A multimodal collaborative fusion network for fine-grained semantic classification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.334363Z"},"links":{"cited_paper":"/paper/2505.23365","citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:38b917d5d79b139a130f5b6ce126b9ee6a2ec8f09adec0509c7de81086bc8248","observation_id":"523a052e-91f2-4382-b937-9961366a4c32","resolution":{"observed_at":"2026-08-02T03:33:57.334363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:57.449823Z","title":"A simple framework for contrastive learning of visual representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.449823Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:2458b80f6957dd2676b063c6d51f6bf515e5fcc700ba667c830d9be756c18a01","observation_id":"0f425487-771b-4854-94b2-1fcb5aebe8a4","resolution":{"observed_at":"2026-08-02T03:33:57.449823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:57.511092Z","title":"A ConvNet for the 2020s,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.511092Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:6153169619b94fb11f4d6df32b385f400698a6277f4e0b674a7c2b51dd7c551a","observation_id":"8fff4c05-fe55-425d-a6e2-08f0cb74e0c3","resolution":{"observed_at":"2026-08-02T03:33:57.511092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:57.746800Z","title":"MAXIM: Multi-axis MLP for image processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.746800Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:d659b6761fc068ca0986fb6cd2a1a0e49411f76cd354f08a49ff0665bc4eaa55","observation_id":"f3347968-74d5-4695-8a92-421669849ac3","resolution":{"observed_at":"2026-08-02T03:33:57.746800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:57.852059Z","title":"Domain-specific language model pretraining for biomedical natural language processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.852059Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:4dca8e9b1cf517caf315c5befacae18ef902c57e646c3bae778cbc7bcf94a43f","observation_id":"697b5d7a-49a1-45f5-b571-8aadd539ebcb","resolution":{"observed_at":"2026-08-02T03:33:57.852059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16707","last_updated":"2026-06-22T18:16:59Z","snapshot_observed_at":"2026-07-06T16:53:43.840652Z","submitted_at":"2023-11-28T11:32:23Z","title":"Full-resolution MLPs Empower Medical Dense Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16707","snapshot_observed_at":"2026-08-02T03:33:57.687295Z","title":"Available: https://arxiv.org/abs/2311.16707","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.687295Z"},"links":{"cited_paper":"/paper/2311.16707","citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:c7c12b7ff479473828a9b417c7a0f7143a2bae89e45b0bfc7b8932349bf3649f","observation_id":"8033f2c1-9253-42a0-be9a-26c6e8d8cd9b","resolution":{"observed_at":"2026-08-02T03:33:57.687295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:58.027923Z","title":"Focal loss for dense object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:58.027923Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:7a4c5d610ba728b3ba3a03a30152d1231f046d19b97f9c3c8b84c9f6d1e4732c","observation_id":"23feed39-6b28-4a5c-86cf-782f467a7724","resolution":{"observed_at":"2026-08-02T03:33:58.027923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07706","last_updated":"2024-06-20T09:14:54Z","snapshot_observed_at":"2026-07-06T16:06:22.526631Z","submitted_at":"2023-08-15T11:28:21Z","title":"Exploring Transfer Learning in Medical Image Segmentation using Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07706","snapshot_observed_at":"2026-08-02T03:33:58.108632Z","title":"Exploring transfer learning in medical image segmentation using vision–language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:58.108632Z"},"links":{"cited_paper":"/paper/2308.07706","citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:129b7a432b724c87c21d1e69064512a2e5a20b1877896568d0a5b64e11f46d39","observation_id":"f70ff458-afdc-4d65-9121-9f4983c604c3","resolution":{"observed_at":"2026-08-02T03:33:58.108632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:57.926438Z","title":"V-Net: Fully convolutional neural networks for volumetric medical image segmentation,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:57.926438Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:2b629c694bbb39941b9157f3aadb69e402ee0f646b082c1c6cd1ace715b46814","observation_id":"69ef79aa-7110-4cb2-8a15-2e0736a3ea21","resolution":{"observed_at":"2026-08-02T03:33:57.926438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:58.185821Z","title":"Segment anything in medical images,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:58.185821Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:2b20e73bef3ae273acbbd22ca6475366d548cda20e8e9312860d8e857d83bd41","observation_id":"c63de55a-87be-4207-830c-84485f4de916","resolution":{"observed_at":"2026-08-02T03:33:58.185821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.06465","last_updated":"2020-05-13T13:04:37Z","snapshot_observed_at":"2026-08-04T06:53:47.606776Z","submitted_at":"2020-05-13T13:04:37Z","title":"MosMedData: Chest CT Scans With COVID-19 Related Findings Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.06465","snapshot_observed_at":"2026-08-02T03:33:55.775010Z","title":"Available: https://arxiv.org/abs/2005.06465","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:55.775010Z"},"links":{"cited_paper":"/paper/2005.06465","citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:c1daf92d8e457d43717f999c1ae71b22087fa2172461fd9151ba1b3799777abc","observation_id":"2dec7d51-e1b5-41e9-8e07-6d2665f21209","resolution":{"observed_at":"2026-08-02T03:33:55.775010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T03:33:58.234123Z","title":"degree and is a jointly trained Ph.D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:58.234123Z"},"links":{"citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:6dde43855663ba59fb97548b87ea5b9358dda19aaa418f382f602b4acaaa4005","observation_id":"40b3cb24-6c6a-4d6c-ab2a-37cc6cee5990","resolution":{"observed_at":"2026-08-02T03:33:58.234123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00915","last_updated":"2025-01-08T22:58:51Z","snapshot_observed_at":"2026-07-06T14:57:39.647497Z","submitted_at":"2023-03-02T02:20:04Z","title":"BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00915","snapshot_observed_at":"2026-08-02T03:33:54.719761Z","title":"Available: https://arxiv.org/abs/2303.00915","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T03:33:54.719761Z"},"links":{"cited_paper":"/paper/2303.00915","citing_paper":"/paper/2607.16327"},"observation_digest":"sha256:2b492e34ff229ae4bb7e12cf5ea8dc8b4be1f10da3630307ca3227ba0c42a15b","observation_id":"59f09a0d-0f69-4929-aae7-d780548d24aa","resolution":{"observed_at":"2026-08-02T03:33:54.719761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16327","last_updated":"2026-07-15T14:06:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T22:11:28.362340Z","submitted_at":"2026-07-15T14:06:17Z","title":"Localization-Infused Vision-Language Semantic Fusion for Text-Guided Medical Image Segmentation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2607.16327."}