{"as_of":"2026-08-18T18:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c62e33da92267ce3f637fa33820f1d2a38ae7ecd4229ffbc8e0bed28d835872f","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:27:24.486647Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.15123/citation-record","integrity":"/paper/2505.15123/integrity","json":"/paper/2505.15123/citation-record.json","paper":"/paper/2505.15123"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:21.515099Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:21.515099Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:2a14dc7574fc7c420236889e39b7be4d2102e85c054a62b1a8cdaf59c1224c45","observation_id":"2f20f9cd-1521-4405-a2af-73f8028cceec","resolution":{"observed_at":"2026-08-07T15:27:21.515099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.910772Z","title":"Detector-free weakly supervised grounding by separation","venue":null,"work_id":"262310ad-66ad-432e-b038-405e44d67d73","year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:21.547480Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:620dd7264926e68b141c2b35b6ee6aee26e00b978503232645047174493a0740","observation_id":"9f9893fc-7d8e-44f3-9f3e-2cded8986c0f","resolution":{"observed_at":"2026-08-07T15:27:25.915628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17274","last_updated":"2022-06-03T17:52:04Z","snapshot_observed_at":"2026-08-18T15:22:56.094984Z","submitted_at":"2022-03-31T17:59:30Z","title":"Exploring Visual Prompts for Adapting Large-Scale Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17274","snapshot_observed_at":"2026-08-07T15:27:21.565626Z","title":"Exploring visual prompts for adapting large- scale models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:21.565626Z"},"links":{"cited_paper":"/paper/2203.17274","citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:f066277eec9e71227578c4e0af86ac160f251dfc9058302b27006ea8660e6c65","observation_id":"a3177020-49a8-40e6-b885-eefd51385243","resolution":{"observed_at":"2026-08-07T15:27:21.565626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.895517Z","title":"Learning to exploit temporal structure for biomedical vision-language processing","venue":null,"work_id":"88f54bfd-9709-445d-8d94-ff18cb785257","year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:21.653820Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:bb0e31e8c58628d1fc68a2ae17b7c2a974ff282c7af7a3d3bc38ceb7967fc703","observation_id":"3416f9d8-ea41-4b30-bd3a-1a222f9a465d","resolution":{"observed_at":"2026-08-07T15:27:25.900500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.879502Z","title":"Im- proving pneumonia localization via cross-attention on med- ical images and reports","venue":null,"work_id":"f267abe3-1996-4154-b548-7ac082877b69","year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:21.723948Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:26eca018a01a3fed2f422098cd05fe37c60db5019e38962af1ea5825a52d6af7","observation_id":"c236f2ef-358c-4fb9-a556-e8b35af29b94","resolution":{"observed_at":"2026-08-07T15:27:25.884236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.864722Z","title":"Making the most of text semantics to improve biomedical vision–language processing","venue":null,"work_id":"f1fdd0cb-8043-4854-9175-0c074c0117c3","year":2022},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:21.769655Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:3c6eb483b582fe0588c66612a5fca8258698eb23835ea1f5482e2eade32aff75","observation_id":"896d6bdb-9f38-4c4e-947e-026a1bab3bbe","resolution":{"observed_at":"2026-08-07T15:27:25.869433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.849605Z","title":"Coco- stuff: Thing and stuff classes in context","venue":null,"work_id":"d0aba9cb-dcf9-4d8b-b5b0-e5d48cddd97b","year":2018},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:21.834741Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:2bd2a476403755450d89deec603da95932b27e6685194df4fd6e814cec0b46bc","observation_id":"20524315-86fb-4bdf-a880-ea4c9fce9d90","resolution":{"observed_at":"2026-08-07T15:27:25.854728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:21.954245Z","title":"Generic attention- model explainability for interpreting bi-modal and encoder- decoder transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:21.954245Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:d0cf380269bf237c668b6675e781e8e1f7bde48f33e1e985e502f18e8ace5d02","observation_id":"a9391a63-6744-417f-877a-50b342985715","resolution":{"observed_at":"2026-08-07T15:27:21.954245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.808293Z","title":"Knowledge aided consistency for weakly supervised phrase grounding","venue":null,"work_id":"edfcca3f-c1a1-4fee-9708-2975c489f12c","year":2018},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.061692Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:648b8bcc3d774433319becea2b3a5c3bcc73fec4249c30049f572ce4e243d659","observation_id":"67be6692-4e7d-4415-aa9a-e7e907ac3d6e","resolution":{"observed_at":"2026-08-07T15:27:25.813056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.791556Z","title":"Querymatch: A query-based contrastive learning framework for weakly supervised visual grounding","venue":null,"work_id":"08f33c78-59b6-41ab-a879-07f522eff32a","year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.134897Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:71198ff34be2adba99f24420530b699e16639c600ad56f0e433a1ab44893750a","observation_id":"cf0cadaa-ffae-4f77-86d8-52b0f6977666","resolution":{"observed_at":"2026-08-07T15:27:25.797627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.776101Z","title":"Medical phrase ground- ing with region-phrase context contrastive alignment","venue":null,"work_id":"680e89a1-b290-47b9-8562-46d6785afc32","year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.179752Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:9b673f8bd7d385f88451a19d89613801a7b1c6b19936c9edb6b3ef6aec6e1cb6","observation_id":"0022b111-94ac-479c-80fe-4f59b0997180","resolution":{"observed_at":"2026-08-07T15:27:25.780726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12208","last_updated":"2024-12-18T20:56:18Z","snapshot_observed_at":"2026-08-16T14:25:27.106074Z","submitted_at":"2024-01-22T18:51:07Z","title":"A Vision-Language Foundation Model to Enhance Efficiency of Chest X-ray Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12208","snapshot_observed_at":"2026-08-07T15:27:22.224494Z","title":"Chexagent: Towards a foun- dation model for chest x-ray interpretation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.224494Z"},"links":{"cited_paper":"/paper/2401.12208","citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:c276948be190335285f64553aa9206ee242a62f07f37bda7bab23b2546732aae","observation_id":"39d4635b-8722-4f76-981a-b727d611bb67","resolution":{"observed_at":"2026-08-07T15:27:22.224494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.758699Z","title":"Randaugment: Practical automated data augmen- tation with a reduced search space","venue":null,"work_id":"c6b8259e-26e3-4b96-8375-33a33564936a","year":2020},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.339633Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:6dd6da9f8b908881329ae8911dc532e6e248b20f8caca175ff8d39f87866585c","observation_id":"2312244e-b175-47bc-8e74-12cf4fa9345f","resolution":{"observed_at":"2026-08-07T15:27:25.765128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.741590Z","title":"Align2ground: Weakly supervised phrase grounding guided by image-caption align- ment","venue":null,"work_id":"655dfba5-dcec-40cc-85c2-0aab871d72a4","year":2019},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.384732Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:88f2d1ecb69c69364dc9b3875b11c728f9c0b5ebc1edaf178b4481a209cd25a9","observation_id":"cb559d53-c7c2-427c-8cdc-d6f59c7f165d","resolution":{"observed_at":"2026-08-07T15:27:25.746808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.725067Z","title":"Transvg: End-to-end visual ground- ing with transformers","venue":null,"work_id":"2bedf1de-b088-4e9b-8d04-1ceda574d683","year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.439252Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:40daacbc25ce53719b7e15ca1da4f16c85a67a008f0f71785feeb5c4bba8afd7","observation_id":"43ce920c-12b3-4ed1-86f1-a7317df769a8","resolution":{"observed_at":"2026-08-07T15:27:25.730680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.707375Z","title":"Chest imaging representing a covid-19 positive rural us population","venue":null,"work_id":"8f73e67a-9afb-426e-a6a5-a95bdc7d9484","year":2020},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.513134Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:9b4d780324e254994a426497ef1ece4eb8dfef74f521cfdfdea80d2dbe915b41","observation_id":"f2e9fb2b-ccd5-43ce-90b7-99026d01a512","resolution":{"observed_at":"2026-08-07T15:27:25.714343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.691371Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":"cd08c680-b862-4169-8545-2052c673c0bc","year":2014},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.722272Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:64d453f12f6abac200bab4b4836876c23840340b8ab8829423b4df995c99da37","observation_id":"1220e49c-91e6-4eae-b985-f70d1c54eac0","resolution":{"observed_at":"2026-08-07T15:27:25.697048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.674288Z","title":"Neural se- quential phrase grounding (seqground)","venue":null,"work_id":"f11f5da9-26d0-421c-bb65-5adf5211ecc7","year":2019},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.815176Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:9a8c78b33a86a4c0f5235ffbb49e0a35ec0bbf0aa21e652b1994ead843a43b9c","observation_id":"4b767571-d09a-4669-820b-d489674e4fe7","resolution":{"observed_at":"2026-08-07T15:27:25.679253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:22.845556Z","title":"Learning to prompt for open-vocabulary ob- ject detection with vision-language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.845556Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:0589b7469b5f3bb97efaa3964d305dba06c7a01b463ef4095f6611daf7f975be","observation_id":"2230342b-71bb-4e1e-8472-f8f15393bbcd","resolution":{"observed_at":"2026-08-07T15:27:22.845556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.648317Z","title":"Medrax: Medical reasoning agent for chest x-ray, 2025","venue":null,"work_id":"c519f684-9630-4b06-90a8-03bbd7131904","year":2025},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:22.886020Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:818c55643295434593668b4591adf637c10e4a0b2bfa1ec91a137c6db0570fab","observation_id":"3902d161-2c3e-491c-a87c-07f614dedb20","resolution":{"observed_at":"2026-08-07T15:27:25.653125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.630760Z","title":"Contrastive learning for weakly supervised phrase grounding","venue":null,"work_id":"19236a77-44a3-4561-9c41-570c232e37a7","year":2020},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.016809Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:b5405fba00a85ca76bba3f92c9ab9b55bff2bfe178057151736a873764529163","observation_id":"e3120ba6-c6ee-42fd-9349-b05c84416fa3","resolution":{"observed_at":"2026-08-07T15:27:25.636925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23822","last_updated":"2024-10-31T11:07:26Z","snapshot_observed_at":"2026-08-16T20:51:52.750537Z","submitted_at":"2024-10-31T11:07:26Z","title":"Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding","version":1},"cited_work":{"arxiv_id":"2410.23822","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.23822","snapshot_observed_at":"2026-08-07T15:27:24.809687Z","title":"Parameter-Efficient Fine-Tuning Medical Multimodal Large Language Models for Medical Visual Grounding","venue":"cs.CV","work_id":"c9745967-f036-4f03-a210-68013516a230","year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.081062Z"},"links":{"cited_paper":"/paper/2410.23822","citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:fe084fe299ec256ee7fdf7a77b0c807202e6c12d2cb59d8148a259aa6aee61a9","observation_id":"5a02727f-df45-4f4e-bc18-5e82890a4c5b","resolution":{"observed_at":"2026-08-07T15:27:24.815273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.611132Z","title":"Improved visual ground- ing through self-consistent explanations","venue":null,"work_id":"e1dc0ebb-d8c8-45e9-87ec-24406f11e1bd","year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.136167Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:c5a34f05bcd9a6b9c8a8a055e1b3e655783b219403e10e88d62b743943271b36","observation_id":"98aee0a4-cc98-4fc0-87cb-58380dad96a0","resolution":{"observed_at":"2026-08-07T15:27:25.617105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.593035Z","title":"Multi-grained attention with object-level ground- ing for visual question answering","venue":null,"work_id":"aa28c6aa-d5f5-4f6f-bfcc-c9e39ad26058","year":2019},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.232298Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:83a12b518e1fe9643d28e28cfcf4aa25c3bf9c4fd1b35e58ed6e04205ff4a32e","observation_id":"b2036a8b-ffe5-4ecd-bfe5-e59c2835945e","resolution":{"observed_at":"2026-08-07T15:27:25.599321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.575558Z","title":"Verjans, Minh-Son To, and Vu Minh Hieu Phan","venue":null,"work_id":"96649fc8-d8c7-4df4-a7d4-5ae2dd0970b9","year":2025},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.342306Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:935f04f8cd3d3bb48e107d0631ca9d186a2847aba7fb96868dbfcd7d41532284","observation_id":"8fca1f9d-fbd2-4caa-86bc-47279c2a3e70","resolution":{"observed_at":"2026-08-07T15:27:25.580866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.558621Z","title":"Visual grounding of whole radiology reports for 3d ct images","venue":null,"work_id":"02c8a062-d895-49f0-b43e-6e6b5a7af7a0","year":2023},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.388900Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:84e31437a38d8756e67a8f33dadb98e9d38eec2f449dccdf7fbdf1f9729cca34","observation_id":"c89228c2-15da-4118-9076-6c2952c754a6","resolution":{"observed_at":"2026-08-07T15:27:25.563906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.542171Z","title":"Rad- graph: Extracting clinical entities and relations from radiol- ogy reports","venue":null,"work_id":"eddec36e-99ae-422e-8289-c0df8f624de2","year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.444482Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:570e8fbe93a414cf91c4fc286c6a332094f296b85de18b1d30371e194978a507","observation_id":"65c7cf3c-ad1e-48a3-9b11-db09eec0c216","resolution":{"observed_at":"2026-08-07T15:27:25.547560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:23.547302Z","title":"Scaling up visual and vision-language representa- tion learning with noisy text supervision","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.547302Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:18c80dc16416cdf8e699d54f19702deae7c7d3fa3b1bc3f85693955c40e504cc","observation_id":"b627d61a-a152-452f-995c-31204b77cd52","resolution":{"observed_at":"2026-08-07T15:27:23.547302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.513723Z","title":"Vi- sual prompt tuning","venue":null,"work_id":"851fb84e-2bed-41b2-89ea-ba8f2fd0954d","year":2022},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.622499Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:4f81896c8c7c862e788ec3389152cdfbacb2defcf2f7904e73d26ec3b20ae8c3","observation_id":"2c2b7311-c0b3-49fe-b281-627080739762","resolution":{"observed_at":"2026-08-07T15:27:25.518625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.494632Z","title":"Pseudo-q: Generating pseudo language queries for visual grounding","venue":null,"work_id":"75e08f6a-12da-49f9-a152-5fb0ed676c81","year":2022},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.665674Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:9e253b7c77963c3f02d179d143301f0ae2f4ab0d7206c90bb6ebc6c2d7c683d4","observation_id":"205c995a-911c-4833-b275-2ed85c45b5bd","resolution":{"observed_at":"2026-08-07T15:27:25.501505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.476959Z","title":"Refclip: A universal teacher for weakly supervised referring expression comprehension","venue":null,"work_id":"6aa95347-1535-4897-aba2-d30a6916bb13","year":2023},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.705711Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:f9e22f8d9e2425b183bf18b6b7115faf169422d9722114d5c76ef0aeba05e738","observation_id":"23e2ac20-0386-4670-8441-e725202e18b6","resolution":{"observed_at":"2026-08-07T15:27:25.483022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.460585Z","title":"Mimic-cxr, a de- identified publicly available database of chest radiographs with free-text reports","venue":null,"work_id":"4ebf4f06-d504-4e95-b141-532132f07aee","year":2019},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.812444Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:9b1d00e66d777f7cc418b906594cefe5f2fda85de00617a9d2db51a67875da9f","observation_id":"23d3e97a-dec2-46c4-8633-6cdfb53afbdb","resolution":{"observed_at":"2026-08-07T15:27:25.466353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.442701Z","title":"Deep visual-semantic align- ments for generating image descriptions","venue":null,"work_id":"2d45e101-f4b5-4c46-9a1a-7765fd031614","year":2015},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.817389Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:5ec62cc826c0418b4f7b39bf17a0de842b80e796dc464b11cac95f610dd1dedc","observation_id":"82a99970-fe6c-47fb-8cf2-2d81f45141be","resolution":{"observed_at":"2026-08-07T15:27:25.448618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.426636Z","title":"Maple: Multi-modal prompt learning","venue":null,"work_id":"46f89049-4e7c-46aa-8f4f-1f997c6c282b","year":2023},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:23.968445Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:4af42b498ceb80e9a360edc4ea416969aede2a4d512411bd3d8ed879799fd2f0","observation_id":"287b948e-d830-4489-9e77-4051caf9200b","resolution":{"observed_at":"2026-08-07T15:27:25.431737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.409069Z","title":"Covlm: Compos- ing visual entities and relationships in large language models via communicative decoding","venue":null,"work_id":"3d2ed083-96ec-4fbd-ab9e-8bfe9177d5ae","year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.029605Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:7038a4752dc1aafba6603bdc26ae6ec5009eafbedf2a72484b0f657602eb35c5","observation_id":"b82d452a-e73d-4a57-af9a-555d3a3f9dd0","resolution":{"observed_at":"2026-08-07T15:27:25.414889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.390742Z","title":"Visual prompt tuning for weakly supervised phrase grounding","venue":null,"work_id":"6ca8042e-e8fb-440e-8921-a0c69dbefecb","year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.078264Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:e0d3a7a72e828221d1fa8908074469d079304fb2eab4487cc9e752b1ad06d519","observation_id":"b2829c60-cba5-4903-9634-793a4d567bc7","resolution":{"observed_at":"2026-08-07T15:27:25.396323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.373518Z","title":"Adaptive recon- struction network for weakly supervised referring expression grounding","venue":null,"work_id":"bca407cb-e01e-48ba-bc9d-2b2095b94b0d","year":2019},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.232523Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:5b3709f09306faeb1e3db48e827359bef2939d62dc00afc5413a97e27ac9c2a9","observation_id":"2ee67b35-674d-4942-a788-9be5a328603e","resolution":{"observed_at":"2026-08-07T15:27:25.378739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.351052Z","title":"Knowledge-guided pairwise recon- struction network for weakly supervised referring expression grounding","venue":null,"work_id":"5ef8858a-eb5e-4f6a-ae3e-e1e8179db747","year":2019},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.305889Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:c691ee35b26f972101290d5c35c11e94331a52e76ed5e818e2f55b4f50dbe38b","observation_id":"bd3c493c-7db9-4a8c-ba8e-cf7495e1f69a","resolution":{"observed_at":"2026-08-07T15:27:25.360884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.331363Z","title":"Relation- aware instance refinement for weakly supervised visual grounding","venue":null,"work_id":"19629484-8a50-4358-9560-b4066805213e","year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.319662Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:37f1362c65f0005d88e8f2fee624f7c5fabe9ddb62ad84416a3c1e0056426360","observation_id":"a9045816-b320-4eb3-9c51-ff16d9985fd3","resolution":{"observed_at":"2026-08-07T15:27:25.337111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.312465Z","title":"Confidence-aware pseudo-label learning for weakly super- vised visual grounding","venue":null,"work_id":"d4bfaadc-443f-44aa-bc11-f17d63b64631","year":2023},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.324978Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:f37057659bb7aca831a882c01d326f6af6a2628d1c4a0c5f13abab447619838a","observation_id":"1d859626-93dc-4dd3-82ca-c0c28bb37c95","resolution":{"observed_at":"2026-08-07T15:27:25.318478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12694","last_updated":"2025-02-18T08:49:57Z","snapshot_observed_at":"2026-08-18T10:18:48.502861Z","submitted_at":"2024-10-16T15:54:11Z","title":"VividMed: Vision Language Model with Versatile Visual Grounding for Medicine","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12694","snapshot_observed_at":"2026-08-07T15:27:24.330648Z","title":"Vividmed: Vision language model with versatile visual grounding for medicine","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.330648Z"},"links":{"cited_paper":"/paper/2410.12694","citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:ba0753d6b34db732761409bc1efa34e98ac4c078603a2e2302cc1fbe0885270d","observation_id":"93f57f9a-d121-4f39-9a95-0c1f6bb6c74b","resolution":{"observed_at":"2026-08-07T15:27:24.330648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.292662Z","title":"Localizing be- fore answering: A hallucination evaluation benchmark for grounded medical multimodal llms","venue":null,"work_id":"e5a1c3a4-3104-4246-a192-c718e5e0b5db","year":2025},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.336043Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:3afa704dd11b8626c396f3dbe7f77b169287c8e073402aadd3e9faff760c769e","observation_id":"977ea515-a270-4cba-b964-5a0b941a946b","resolution":{"observed_at":"2026-08-07T15:27:25.300315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.275649Z","title":"Gpt-4 technical report, 2023","venue":null,"work_id":"11420e0c-86b5-45cf-80b7-41d6bfa17b1f","year":2023},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.340873Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:d9c0386bfa00bf3d9a0a5a036a4558595f1545016bd23659f7054a1a3a8074da","observation_id":"4a0688e0-c67a-46b7-be24-39e49f4f4456","resolution":{"observed_at":"2026-08-07T15:27:25.280907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.258077Z","title":"Decomposing disease de- scriptions for enhanced pathology detection: A multi-aspect vision-language pre-training framework","venue":null,"work_id":"b29ca59d-3388-48dc-a161-1470ade47086","year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.346516Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:b79ab9330161af5a591517365887525d2d8fd8c5670282324bac5fed27e165b8","observation_id":"19a626a4-e9f1-4c24-95b8-74e343a5220e","resolution":{"observed_at":"2026-08-07T15:27:25.263902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.233946Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"3942e821-483c-475c-a126-b381033e619f","year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.352483Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:06b57f174967714358eda36a71fa245be1e8507cae312d36f70b1cbf56ec0a27","observation_id":"82afdf19-dc02-4a02-993f-844e921fa15c","resolution":{"observed_at":"2026-08-07T15:27:25.241104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:24.357610Z","title":"Grounding of textual phrases in images by reconstruction","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.357610Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:116a508ad3232c25ede91a9f20d61275a9276185b6c69293ae6055142f15122d","observation_id":"917bd957-09b4-4c44-9343-42590374f215","resolution":{"observed_at":"2026-08-07T15:27:24.357610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.200802Z","title":"Similarity maps for self- training weakly-supervised phrase grounding","venue":null,"work_id":"cc30beab-a07f-48f6-a6eb-c21f0ce07f7e","year":2023},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.363051Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:008b2665bd141d904232507f42b48c6fa886a4272c718b180e9a52b5dc922543","observation_id":"16a025b8-aeca-4b52-aca9-e9ecc2c48134","resolution":{"observed_at":"2026-08-07T15:27:25.209336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.169467Z","title":"What is where by looking: Weakly-supervised open-world phrase- grounding without text inputs","venue":null,"work_id":"38133fe1-77c8-4eb5-a6a4-caa4fa564dfb","year":2022},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.367722Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:dbf22b00bf192e59143e93fa109c070d2c0bd4ae7de5ef5478431eb025b8cf52","observation_id":"690d67a2-a5e3-4e85-9615-04bbfad034cb","resolution":{"observed_at":"2026-08-07T15:27:25.175871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.144934Z","title":"Augmenting the national institutes of health chest radiograph dataset with expert annotations of possi- ble pneumonia","venue":null,"work_id":"9af7ad31-38d2-4e37-a171-df43b9f84bb3","year":2019},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.372678Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:27fc79f3cab40125964722fc146567ba2ac866c8d1f0c9d868802e46e93d5515","observation_id":"e5ce2b65-5e96-475b-b497-1113b6c1d868","resolution":{"observed_at":"2026-08-07T15:27:25.156053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.03831","last_updated":"2018-06-11T06:58:19Z","snapshot_observed_at":"2026-08-17T21:50:33.641027Z","submitted_at":"2018-06-11T06:58:19Z","title":"Interactive Visual Grounding of Referring Expressions for Human-Robot Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.03831","snapshot_observed_at":"2026-08-07T15:27:24.377929Z","title":"Interactive visual grounding of referring expressions for human-robot interaction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.377929Z"},"links":{"cited_paper":"/paper/1806.03831","citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:a507350abb242be36ead6374e23b6ac6e3de5c2718e4239c2fb6685785b62613","observation_id":"e119af83-37ae-4cba-bc26-9d901ecd8ca6","resolution":{"observed_at":"2026-08-07T15:27:24.377929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.128092Z","title":"What does clip know about a red circle? vi- sual prompt engineering for vlms","venue":null,"work_id":"4dffdc17-97da-4690-aa84-b5e6ba93b8bb","year":2023},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.383868Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:81d4142985c124c64dc230eb3039e7f93f71c36029e298d09858abf2935a49c4","observation_id":"cb0858b4-f8df-4d3e-9e0a-3ca00d55e9a8","resolution":{"observed_at":"2026-08-07T15:27:25.133458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.110691Z","title":"Discriminative triad matching and reconstruc- tion for weakly referring expression grounding","venue":null,"work_id":"34ab55e3-1c60-4fb8-8586-b0c96686ce83","year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.389140Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:871905c57a7c42bbe2c71de4592f5916317d5145ba47656602caa4471cb848b4","observation_id":"ccb34278-da29-4e06-be65-7b119fb95e98","resolution":{"observed_at":"2026-08-07T15:27:25.117289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.088781Z","title":"Expert-level detection of pathologies from unannotated chest x-ray images via self- supervised learning","venue":null,"work_id":"4e232718-91fa-4d8a-9653-15e9a29ec913","year":2022},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.393936Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:2911f017c7c335041b4e81cb7faa84bd7f802bc4fa31813d7668d3e19750f925","observation_id":"80e253ac-89db-4816-8da8-b48324da3713","resolution":{"observed_at":"2026-08-07T15:27:25.094777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.067320Z","title":"Few-shot visual grounding for natural human-robot interaction","venue":null,"work_id":"713af0dd-684b-4aca-afcd-c9929681095b","year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.399343Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:d08a1f5986fb22b0bf622fd6ae25960278f4dd2b8516769dc040b0a9fcb44e11","observation_id":"1b100858-ba70-4495-a5f6-861f0a986377","resolution":{"observed_at":"2026-08-07T15:27:25.073288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.045724Z","title":"Found a reason for me? weakly-supervised grounded visual question answering us- ing capsules","venue":null,"work_id":"a7a703b2-b070-41a1-875e-a9da08b028ae","year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.404571Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:cb299d94379d9408df5205ef0f903ca9ab38c7c64c66cd3e3b7084e98a02fef5","observation_id":"d8a3026e-3615-4266-bbf8-f25eb2652c01","resolution":{"observed_at":"2026-08-07T15:27:25.054302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.020674Z","title":"A framework for interpretability in machine learn- ing for medical imaging","venue":null,"work_id":"acf7b600-fe74-404d-af0c-7049fafae567","year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.409037Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:3c27f171580261f8555b8ee272bd68e4c20b7fc95664c6fe203c8964bb74c957","observation_id":"cf6dc9da-27a3-4f52-981b-4c543d9ce71d","resolution":{"observed_at":"2026-08-07T15:27:25.028400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.000024Z","title":"Phrase localization without paired training examples","venue":null,"work_id":"3068804c-ec1b-4901-a169-28ea58f0029f","year":2019},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.413789Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:5db58a58d4fe063766e5ad8ac1dd062fa5388e17a498c36a88f81e88b01ab41e","observation_id":"7ad7e45c-db9f-4730-a553-70c3cd68a6dd","resolution":{"observed_at":"2026-08-07T15:27:25.007002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:24.982572Z","title":"Improving weakly supervised visual ground- ing by contrastive knowledge distillation","venue":null,"work_id":"62195a22-a119-428c-9af8-656cc90a2a31","year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.418799Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:2cf41b4695477afe79c1fbcc7e0eb629cc9b02573c745f991c39af1564e07280","observation_id":"37c9d7c2-2ae0-4e50-a5a8-59a3c52936ab","resolution":{"observed_at":"2026-08-07T15:27:24.989415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14563","last_updated":"2024-07-18T20:29:49Z","snapshot_observed_at":"2026-08-16T13:32:54.690195Z","submitted_at":"2024-07-18T20:29:49Z","title":"Learning Visual Grounding from Generative Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14563","snapshot_observed_at":"2026-08-07T15:27:24.423982Z","title":"Learning visual grounding from generative vi- sion and language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.423982Z"},"links":{"cited_paper":"/paper/2407.14563","citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:99a776a6febab742d5fcf04c08df1168947860f4d28e0e98c034046846e261bc","observation_id":"ca30bc45-839b-443e-be87-f652c7672f5a","resolution":{"observed_at":"2026-08-07T15:27:24.423982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:24.960250Z","title":"Medclip: Contrastive learning from unpaired medical images and text","venue":null,"work_id":"84165c17-1f81-47ce-bb6b-49ee0a7f5750","year":2022},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.428888Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:22db15830444eb1d45ad3122e110bc6f3602274616d83cb1cdaec64758b32118","observation_id":"6cd49a2f-75b2-4ffd-af6e-502553d45a31","resolution":{"observed_at":"2026-08-07T15:27:24.968008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:24.935448Z","title":"MedKLIP: Medical knowledge enhanced language-image pre-training","venue":null,"work_id":"d16c4a23-3084-447e-8175-d20db0ba2eef","year":2023},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.434362Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:9f3278be5944758410d42500068d9a173dd6d54cd3b0b482bdfa488a44f530bb","observation_id":"02e86381-a97b-45f9-b934-ef04de9e313c","resolution":{"observed_at":"2026-08-07T15:27:24.944750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:24.904352Z","title":"Rethinking masked image modelling for medical image representation","venue":null,"work_id":"686d3efc-96bf-4b31-8e84-83ccfe4445f0","year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.439028Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:fbbf167ea0b8bdb3435ce7f1554e7dad2c287db84bc1046bc8814a2213788f38","observation_id":"33e89b3a-656d-4701-8a95-ac7aedea0b84","resolution":{"observed_at":"2026-08-07T15:27:24.918857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.14757","last_updated":"2022-12-29T16:36:55Z","snapshot_observed_at":"2026-08-18T03:19:14.470891Z","submitted_at":"2021-12-29T18:56:18Z","title":"A Simple Baseline for Open-Vocabulary Semantic Segmentation with Pre-trained Vision-language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.14757","snapshot_observed_at":"2026-08-07T15:27:24.445011Z","title":"A simple baseline for zero- shot semantic segmentation with pre-trained vision-language model","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.445011Z"},"links":{"cited_paper":"/paper/2112.14757","citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:d38134b831aecec03bdd37df420b812e1d2d3ca58b8f282e97590600578b9ea1","observation_id":"30f20f27-6e28-4288-9183-b534cf794ff0","resolution":{"observed_at":"2026-08-07T15:27:24.445011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-07T15:27:24.456585Z","title":"Florence: A new foundation model for computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.456585Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:50b74791c32e440912e7094a73043d76d9f247e2826a7ec8a19e25df27bdab54","observation_id":"5e8a2ed7-223d-47bd-ad3b-74c5efaefb69","resolution":{"observed_at":"2026-08-07T15:27:24.456585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00915","last_updated":"2025-01-08T22:58:51Z","snapshot_observed_at":"2026-08-18T14:56:57.492279Z","submitted_at":"2023-03-02T02:20:04Z","title":"BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00915","snapshot_observed_at":"2026-08-07T15:27:24.462822Z","title":"Biomedclip: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.462822Z"},"links":{"cited_paper":"/paper/2303.00915","citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:eb6aa9738ef9c0c457007062a91414090cb0a9816e9b8187e52f511816b7df64","observation_id":"451be5c3-98cf-4374-bf2d-95e02ae8352f","resolution":{"observed_at":"2026-08-07T15:27:24.462822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:24.468858Z","title":"Conditional prompt learning for vision-language mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.468858Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:f3b54adcfe50f131201ec8fbbd562abb6c082a18263c2e9d515f9ab293192ccc","observation_id":"83ff10cb-5e7a-47e6-8c01-bef53e1fa1a6","resolution":{"observed_at":"2026-08-07T15:27:24.468858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:24.474354Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.474354Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:2b3129d2b1f79787d718c1be808ca7972b0ce42b19dbb92718e0623919b7efd8","observation_id":"eab34838-7f13-4283-a369-cd5e76acf9e7","resolution":{"observed_at":"2026-08-07T15:27:24.474354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:24.865903Z","title":"Scanreason: Empowering 3d visual grounding with reasoning capabilities","venue":null,"work_id":"dc59367a-f576-47a2-9336-af6f77742930","year":2024},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.480264Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:f74d487470921677ddbc804befc3f62d41d10ac70e21b73a6ec84d384440682e","observation_id":"5b435cc1-5157-4ef7-affe-9758d5f16013","resolution":{"observed_at":"2026-08-07T15:27:24.870915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4210.4120","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:24.670265Z","title":"Read before grounding: Scene knowledge visual ground- ing via multi-step parsing","venue":null,"work_id":"8f0ffc89-6702-4d52-b168-6693d8a23d1a","year":2025},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:24.486647Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:56993acc1f8831f2e77febc365cfbc2ad33430f5d9d0cdbbaf2ff4d0d48a6075","observation_id":"b85f18c6-6d44-4ca3-b5ba-e7ff031059ef","resolution":{"observed_at":"2026-08-07T15:27:24.680975Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:27:25.823591Z","title":null,"venue":null,"work_id":"7fc468cd-ba61-4b1f-8072-45583223110a","year":null},"citing_paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T15:27:21.987649Z"},"links":{"citing_paper":"/paper/2505.15123"},"observation_digest":"sha256:3550f8082fb7f904f114ae235bb8a82c3bb4d01bab4cffc99051bd2c0e2a96ff","observation_id":"82e14d23-428d-480b-bc92-1df061a0972d","resolution":{"observed_at":"2026-08-07T15:27:25.829109Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15123","last_updated":"2025-08-24T14:40:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T10:19:33.001695Z","submitted_at":"2025-05-21T05:16:45Z","title":"Seeing the Trees for the Forest: Rethinking Weakly-Supervised Medical Visual Grounding"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":15,"verified_exact":2,"verified_fuzzy":52},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2505.15123."}