{"as_of":"2026-08-21T19:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:50c35e24d438e5a3d96712e9461826eff81b15f44b262311eb92044b0e7abc74","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:02:21.165503Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08990/citation-record","integrity":"/paper/2506.08990/integrity","json":"/paper/2506.08990/citation-record.json","paper":"/paper/2506.08990"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:20.773766Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.773766Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:b7e0c0d35b3f5e6a3cde26a4f02ae9cc0166144d4866bf62abd866ca2b250357","observation_id":"9fd25426-9bcc-4eb4-bee7-b13f40e3ed74","resolution":{"observed_at":"2026-08-07T05:02:20.773766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.07042","last_updated":"2019-11-14T17:34:51Z","snapshot_observed_at":"2026-08-02T04:11:08.699777Z","submitted_at":"2019-01-21T19:01:00Z","title":"MIMIC-CXR-JPG, a large publicly available database of labeled chest radiographs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.07042","snapshot_observed_at":"2026-08-07T05:02:20.823905Z","title":"Mimic-cxr-jpg, a large publicly available database of labeled chest radiographs,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.823905Z"},"links":{"cited_paper":"/paper/1901.07042","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:833a1011c1ab4b6b9bc23c3a974d81b789b0c0084e939db7e8b6ef19856521c0","observation_id":"247791b4-f9dd-4f94-8849-25c385551f2c","resolution":{"observed_at":"2026-08-07T05:02:20.823905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.997639Z","title":"Chestx-ray8: Hospital-scale chest x-ray database and benchmarks on weakly-supervised classification and localization of common thorax diseases,","venue":null,"work_id":"f6ee2cbc-884b-4ee4-899b-932a52126679","year":2017},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.873856Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:6717f01d0a15abb919dc383323b74b3d627eb9f41a657f788ff508f47658c976","observation_id":"9de23ca4-edcd-4f77-a29c-69e2200a2b5a","resolution":{"observed_at":"2026-08-07T05:02:22.003020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.981360Z","title":"Chexpert: A large chest radiograph dataset with uncertainty labels and expert comparison,","venue":null,"work_id":"1187452c-00a4-431f-b428-b96562eb91cd","year":2019},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.929274Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:9d885a2d683e137f4c347fb20f081806568c1d88dcdd8183b0876d1558f8c02d","observation_id":"dad709e1-77fc-482f-9a7b-e01b3d739726","resolution":{"observed_at":"2026-08-07T05:02:21.986416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:20.949952Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.949952Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:5af834956f954a976d74dc683d708ae450f97ec14063269c37878882b154b758","observation_id":"e8d136c1-2ca1-422c-9dac-c5d1403ff169","resolution":{"observed_at":"2026-08-07T05:02:20.949952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.957238Z","title":"Contrastive learning of medical visual representations from paired images and text,","venue":null,"work_id":"74947619-3794-42ca-9e49-4d71b5283004","year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.954272Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:87d77df8d078e57fa2b9c5286be58c1d570b776548ed8bb8d51a5307ec081a7b","observation_id":"76f20c04-0ca6-4e17-98a2-cea9eab6695c","resolution":{"observed_at":"2026-08-07T05:02:21.961508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.943770Z","title":"Gloria: A multimodal global-local representation learning framework for label- efficient medical image recognition,","venue":null,"work_id":"4a367c7a-e791-48b8-ae19-e92a2c5ee27b","year":2021},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.959477Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:6e3c6015c55eeada6f214ac8ef5f0a6039b6812a52bc5f050b1316df60b70db2","observation_id":"72dc1b6d-e7a1-497c-824a-7adabb02216a","resolution":{"observed_at":"2026-08-07T05:02:21.948018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:20.963272Z","title":"Making the most of text semantics to improve biomedical vision– language processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.963272Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:ecf26311b2fad584b533bc0c5893619746c3ec0a500aa67c04ebb9de8d4ccffc","observation_id":"45fb1f3a-ccf5-48ad-995d-7bbbca04886e","resolution":{"observed_at":"2026-08-07T05:02:20.963272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.918948Z","title":"A multimodal biomedical foundation model trained from fifteen million image–text pairs,","venue":null,"work_id":"de7a3270-fc4f-4a62-9578-df67d96eaa27","year":2025},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.967837Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:5e9870ff98d98158e21e7de7abeb2059760ade92b504cf1e6263e2c75652afa2","observation_id":"e3ef6427-e5b4-4135-9c46-d39e5e22dc4f","resolution":{"observed_at":"2026-08-07T05:02:21.923279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.905063Z","title":"Advancing radiograph representation learning with masked record modeling,","venue":null,"work_id":"21a508ec-5b33-401d-9177-3e319ae9a545","year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.971917Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:d01d306feb7b4aec678729f47406615e33285f9f91cebdd190627cb6859ba688","observation_id":"ac4bc219-aaac-4734-8b41-47db5935ee65","resolution":{"observed_at":"2026-08-07T05:02:21.909308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10815","last_updated":"2025-02-07T12:03:23Z","snapshot_observed_at":"2026-08-20T08:10:11.708845Z","submitted_at":"2024-01-19T17:02:17Z","title":"Exploring scalable medical image encoders beyond text supervision","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10815","snapshot_observed_at":"2026-08-07T05:02:20.975873Z","title":"Rad-dino: Exploring scalable medical image encoders beyond text supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.975873Z"},"links":{"cited_paper":"/paper/2401.10815","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:9bd865d54bc493bb399532e4af3143a42f8bc589f5539719e492ae487048cb4e","observation_id":"1944ea8f-beef-46cf-a372-fdb3f8bab1c2","resolution":{"observed_at":"2026-08-07T05:02:20.975873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06224","last_updated":"2023-12-11T09:14:13Z","snapshot_observed_at":"2026-08-20T05:47:54.146584Z","submitted_at":"2023-12-11T09:14:13Z","title":"Medical Vision Language Pretraining: A survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06224","snapshot_observed_at":"2026-08-07T05:02:20.981003Z","title":"Medical vision language pretraining: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.981003Z"},"links":{"cited_paper":"/paper/2312.06224","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:aac1074d29d58965d9b3674ec4747347169b9d729eb9955457de9bb765cd29ae","observation_id":"cf92113c-2d18-48dd-ab23-d108399a51d8","resolution":{"observed_at":"2026-08-07T05:02:20.981003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.891140Z","title":"Unichest: Conquer-and-divide pre-training for multi-source chest x-ray classifica- tion,","venue":null,"work_id":"dbb129a2-0dda-4189-876b-c98ac822ea48","year":2024},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.985555Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:8038de1f4febe4c1de46f0c360240ff33d3c391a60b085f790698ce179e3b434","observation_id":"1e88a606-8554-46d1-b82d-162313e4065c","resolution":{"observed_at":"2026-08-07T05:02:21.895563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.877124Z","title":"Im- proving medical vision-language contrastive pretraining with semantics- aware triage,","venue":null,"work_id":"0a7052df-2b39-4226-992c-cf978ec5149d","year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.989976Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:91fecf731f79fc4b633a505e7a4c180e8ccecdd6a59ca6ad6897a3a318074844","observation_id":"36067afd-f3b0-47bd-aa4f-44169d599346","resolution":{"observed_at":"2026-08-07T05:02:21.881471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.862745Z","title":"Exploring scalable medical image encoders beyond text supervision,","venue":null,"work_id":"61db241c-eecc-4aab-8ee7-6682325c0b26","year":2025},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.993776Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:80bc21fbb540fb6e40c18ea385ac62330f43b0e6054e48a75304f25048054f03","observation_id":"6d72bb59-ce72-44a4-9a8c-fad5114fa252","resolution":{"observed_at":"2026-08-07T05:02:21.867278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:20.998341Z","title":"Learning to exploit temporal structure for biomedical vision-language processing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:20.998341Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:7058e0bf3248ef0cce77391a06fe46e3d9c54cbcb8b61834dbc387c017bfb3c3","observation_id":"9d5e6252-eb2a-4858-b259-dda8df479418","resolution":{"observed_at":"2026-08-07T05:02:20.998341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.837400Z","title":"Gener- alized radiograph representation learning via cross-supervision between images and free-text radiology reports,","venue":null,"work_id":"aa8f4c3e-29ba-4cc5-9a20-a9c143afe8a2","year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.002149Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:4c8ec97494e9b55561e3a1c248890e0c143a33ac1ba09bac6cc2da2ba7024d07","observation_id":"984b26ad-05cb-41e8-b24a-31d5bad53fe8","resolution":{"observed_at":"2026-08-07T05:02:21.842083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.821073Z","title":"Chexrelnet: An anatomy-aware model for tracking longi- tudinal relationships between chest x-rays,","venue":null,"work_id":"9f030237-57a1-486a-bc46-8fb45cd33ad5","year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.006246Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:06f52e43f52731a55873ef407b25d02e6eec705361585e616a4830eef6378fc9","observation_id":"331a124b-a0f9-40ab-be09-e1410669366b","resolution":{"observed_at":"2026-08-07T05:02:21.826179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.804315Z","title":"Chexfusion: Effective fusion of multi-view features using transformers for long-tailed chest x-ray classification,","venue":null,"work_id":"a976714b-4500-4e0c-aae1-649c0ad0760a","year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.010139Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:9a7d385bc2e373a50137cdcf4c3d482d98d4c841cdcc75de5b99cdd7365602a2","observation_id":"2390c2ce-d423-4c67-9e85-c087b41cd959","resolution":{"observed_at":"2026-08-07T05:02:21.809530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.786815Z","title":"Act like a radiologist: towards reliable multi-view correspondence reasoning for mammogram mass detection,","venue":null,"work_id":"4dc36e7a-afde-4069-a047-644545b89ca2","year":2021},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.014390Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:6d0ce6b2b13784fbd95ab15063514fe8ae937a81ef853e26f11bb3e56e72a98a","observation_id":"9a6e642a-3f72-4cf6-89db-62c0af89edad","resolution":{"observed_at":"2026-08-07T05:02:21.793117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.769156Z","title":"Deltanet: Conditional medical report generation for covid- 19 diagnosis,","venue":null,"work_id":"20dc6e39-c1c5-44b3-9c79-b9f6ee96f11b","year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.019327Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:92973eaf70f668b8159b528a220a592bfe9ba5ba072d021fb530a9f57c8909e0","observation_id":"97f3da43-ea3f-477b-a633-d5d0676e25b3","resolution":{"observed_at":"2026-08-07T05:02:21.775166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.023679Z","title":"Self-supervised learning for medical image analysis using image context restoration,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.023679Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:4aa8a954f918179d761c3ca2a806c989de64dff09b27d242cad0f180522fa85e","observation_id":"67f3d0d5-0c5d-4ed6-ab47-b094e5d444cc","resolution":{"observed_at":"2026-08-07T05:02:21.023679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.740730Z","title":"Models genesis,","venue":null,"work_id":"f70121ae-c06d-4897-b2d0-3454d7d763ae","year":2021},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.027902Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:74ce96eae852b5feb359061197b03d6801686dbc9ddf2abbb4e49b6a8a6fb37b","observation_id":"9266745b-4665-4de7-9dab-56ec3fdc579f","resolution":{"observed_at":"2026-08-07T05:02:21.745864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.722391Z","title":"Comparing to learn: Surpassing imagenet pretraining on radiographs by comparing image representations,","venue":null,"work_id":"a9a45eb2-c0ea-422a-9ea3-50fe32a971cd","year":2020},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.032152Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:fefb9054a161d775dfb1b593ca262496a3f22a814ebb61b067b06bd95263818f","observation_id":"64b13a44-3f32-4af8-b3c9-a5ec1d543910","resolution":{"observed_at":"2026-08-07T05:02:21.728548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.035993Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.035993Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:f8bba80673509f63999826dd4272c599c8b144340dc74b1c5d581b804edd9d3c","observation_id":"092cee43-8f44-407b-85d3-08a0d796bb1e","resolution":{"observed_at":"2026-08-07T05:02:21.035993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.694837Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision,","venue":null,"work_id":"46cc62af-aa18-4768-8946-22efd54e6ac1","year":2021},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.040046Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:e2162b3da10c127dec11ada825f7f4b09da5f7074f3a21e0acb51ea77e89c557","observation_id":"825e5557-90db-47c7-8405-3d29a0b86a88","resolution":{"observed_at":"2026-08-07T05:02:21.700519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.044391Z","title":"Align before fuse: Vision and language representation learning with momentum distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.044391Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:18f34443eabac11805569346dfb149709b1546b2c5c89c6938221e067befe62a","observation_id":"da009c55-246b-49ff-88d3-e3ca112e52dc","resolution":{"observed_at":"2026-08-07T05:02:21.044391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-08-16T16:37:39.300058Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-07T05:02:21.048709Z","title":"Image as a foreign language: Beit pretraining for all vision and vision-language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.048709Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:fec75a6126ced2c64c9100ed7d04bacc6fc45f38932b4c3ed4238ba5b59b6171","observation_id":"31c42f06-88bd-4af9-8adb-30ca8ec081aa","resolution":{"observed_at":"2026-08-07T05:02:21.048709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.666777Z","title":"Knowledge- enhanced visual-language pre-training on chest radiology images,","venue":null,"work_id":"daf07455-8309-404f-a2ae-22b305ce793e","year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.052954Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:39b128fa12fde430f5aec0b72b401fbc3299e08a5d95d82fb2985e46d31a8688","observation_id":"6c061e64-054d-4aa8-a068-8b045d806f30","resolution":{"observed_at":"2026-08-07T05:02:21.672655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.056753Z","title":"Carzero: Cross-attention alignment for radiology zero-shot classifica- tion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.056753Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:595139e2df921e8350e316eb676d4d2a2afb356b75a87e43ffa27fcf83ebc4e9","observation_id":"82213d81-baba-48b2-bfa3-c8891ca4ba0b","resolution":{"observed_at":"2026-08-07T05:02:21.056753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.638722Z","title":"Enhancing representation in radiography- reports foundation model: A granular alignment algorithm using masked contrastive learning,","venue":null,"work_id":"5a1edf50-029a-4679-8d6e-914a60a91343","year":2024},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.060464Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:80233c58dcdec3138c361e0c73d9a4a45c1f5023ac5cc890bd2112340117518f","observation_id":"f7a18f76-d20c-4853-af0a-549b7b906163","resolution":{"observed_at":"2026-08-07T05:02:21.643981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.064175Z","title":"Medklip: Medical knowledge enhanced language-image pre-training for x-ray diagnosis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.064175Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:1f2040ae89dc30e4e108a7886726f8fbf1fdf96d373dd9a9213d8bda46cd8a4e","observation_id":"cf44f368-257a-4fed-8d31-577fdf9d7fc8","resolution":{"observed_at":"2026-08-07T05:02:21.064175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.068498Z","title":"Parameter-efficient transfer learning for nlp,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.068498Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:b04844c47664629982454e29f2521dcdf619df2fbea9758fb124200203bf2f90","observation_id":"e597b183-f5b7-4d40-becd-542f72198e17","resolution":{"observed_at":"2026-08-07T05:02:21.068498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T05:02:21.072896Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.072896Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:8ee13bada2cd390c6bbabfc3ef1a1810272673a293f4088f60e861b0558459a1","observation_id":"4dd1dd1f-afbf-4c0f-9aed-886cfd4e1571","resolution":{"observed_at":"2026-08-07T05:02:21.072896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.591671Z","title":"Few-shot parameter-efficient fine-tuning is better and cheaper than in-context learning,","venue":null,"work_id":"cbffe393-99ca-4e9c-b2eb-54567f77cfc3","year":1950},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.077066Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:e67c0bf49d640839e686aca7f27007458fed370d2d81aac29cbc21fac5901a52","observation_id":"2414083d-5b26-41e4-b267-929771e16a86","resolution":{"observed_at":"2026-08-07T05:02:21.600504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.578041Z","title":"Bitfit: Simple parameter- efficient fine-tuning for transformer-based masked language-models,","venue":null,"work_id":"a8da5392-f677-468e-8044-dfa02bd78315","year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.081187Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:09ed612da70146a258e519edad35df49e76e88b60ad81a85a7956b55da369ffe","observation_id":"adf02300-4504-4571-be33-5c3b7c460cf1","resolution":{"observed_at":"2026-08-07T05:02:21.582459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04366","last_updated":"2022-02-02T16:39:23Z","snapshot_observed_at":"2026-08-18T09:21:01.141614Z","submitted_at":"2021-10-08T20:22:26Z","title":"Towards a Unified View of Parameter-Efficient Transfer Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04366","snapshot_observed_at":"2026-08-07T05:02:21.085120Z","title":"Towards a unified view of parameter-efficient transfer learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.085120Z"},"links":{"cited_paper":"/paper/2110.04366","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:d469f2387fe495e4614ab66aea1c2e71b21eaebdf6894aab3b567929c0e308ed","observation_id":"582f3bc9-43a9-4b30-80ad-3c3bb71c53fa","resolution":{"observed_at":"2026-08-07T05:02:21.085120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.089229Z","title":"Visual prompt tuning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.089229Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:bd2849cb2238489c2db1fd0913d590ad3b70cf984bffb38a1d885ddfc300200e","observation_id":"6d08116e-f5cd-4dc2-9991-c6c6cbcf7a3d","resolution":{"observed_at":"2026-08-07T05:02:21.089229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.552925Z","title":"Vl-adapter: Parameter-efficient transfer learning for vision-and-language tasks,","venue":null,"work_id":"11c2a5e7-8d92-4d0e-a0c2-37971a08f9f6","year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.093214Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:732c14bbdf14f3d63be29ac9c127844b8c52a74a8383578db64754882a0cbc2b","observation_id":"9cb90014-3299-4f7d-bbe1-e5906504b314","resolution":{"observed_at":"2026-08-07T05:02:21.557861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03024","last_updated":"2023-02-06T18:59:17Z","snapshot_observed_at":"2026-08-16T15:57:18.631878Z","submitted_at":"2023-02-06T18:59:17Z","title":"AIM: Adapting Image Models for Efficient Video Action Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03024","snapshot_observed_at":"2026-08-07T05:02:21.096816Z","title":"Aim: Adapting image models for efficient video action recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.096816Z"},"links":{"cited_paper":"/paper/2302.03024","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:298d34894d4f64d26134eb08cf77fa53db8e17919bd16e0200e2154beb82bcdd","observation_id":"cd240235-3b9b-41ee-b783-60e85f662059","resolution":{"observed_at":"2026-08-07T05:02:21.096816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.08534","last_updated":"2023-02-13T15:50:22Z","snapshot_observed_at":"2026-08-19T14:57:47.082151Z","submitted_at":"2022-05-17T17:59:11Z","title":"Vision Transformer Adapter for Dense Predictions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.08534","snapshot_observed_at":"2026-08-07T05:02:21.100923Z","title":"Vision transformer adapter for dense predictions,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.100923Z"},"links":{"cited_paper":"/paper/2205.08534","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:ed3c135d9aa14dc2e28992407dbaf45a560957176ee75e279a686d077a66900e","observation_id":"b1b5eee8-d624-4a21-8933-82b1f20b639e","resolution":{"observed_at":"2026-08-07T05:02:21.100923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08252","last_updated":"2024-06-10T15:11:40Z","snapshot_observed_at":"2026-08-17T16:33:57.432526Z","submitted_at":"2023-05-14T21:18:18Z","title":"Parameter-Efficient Fine-Tuning for Medical Image Analysis: The Missed Opportunity","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08252","snapshot_observed_at":"2026-08-07T05:02:21.105209Z","title":"Parameter-efficient fine-tuning for medical image analysis: The missed opportunity,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.105209Z"},"links":{"cited_paper":"/paper/2305.08252","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:59473d338673ba66ada7553310f259833fdb0c10090c9c1024304ff1473ee8d6","observation_id":"f0189b50-bdb5-4c9c-b43f-64fff44af3f5","resolution":{"observed_at":"2026-08-07T05:02:21.105209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08236","last_updated":"2024-07-22T05:39:53Z","snapshot_observed_at":"2026-08-16T14:43:24.321514Z","submitted_at":"2023-11-14T15:18:54Z","title":"MeLo: Low-rank Adaptation is Better than Fine-tuning for Medical Image Diagnosis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08236","snapshot_observed_at":"2026-08-07T05:02:21.109848Z","title":"Melo: Low-rank adaptation is better than fine-tuning for medical image diagnosis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.109848Z"},"links":{"cited_paper":"/paper/2311.08236","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:a57410693401401bccb3a69512f5c32a3c266b4f4ad25fbd2d27e9ad05fd885e","observation_id":"3cf57145-50b6-4376-b42d-feb2aa78d11f","resolution":{"observed_at":"2026-08-07T05:02:21.109848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12215","last_updated":"2024-01-22T18:59:07Z","snapshot_observed_at":"2026-08-16T14:25:26.933920Z","submitted_at":"2024-01-22T18:59:07Z","title":"Less Could Be Better: Parameter-efficient Fine-tuning Advances Medical Vision Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12215","snapshot_observed_at":"2026-08-07T05:02:21.115036Z","title":"Less could be better: Parameter-efficient fine-tuning advances medical vision foundation mod- els,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.115036Z"},"links":{"cited_paper":"/paper/2401.12215","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:dc5299b86e982065b172b3ccf70deef3555aab97f5b0bf2b5b3fb6ce002574f0","observation_id":"940aa1de-6d6a-46ff-a5c0-aaa6968df2bc","resolution":{"observed_at":"2026-08-07T05:02:21.115036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.536622Z","title":"Prompt tuning for parameter- efficient medical image segmentation,","venue":null,"work_id":"a91e29c0-8173-40a2-aaea-ba96f7b5d026","year":2024},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.119838Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:e3c6562324eaa9c9c886cfe7ec56cd38227f277a07719c7c7ffab916798f42dd","observation_id":"9c12a0b7-ad35-4518-b3c9-b359c796cb09","resolution":{"observed_at":"2026-08-07T05:02:21.542188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.519961Z","title":"Towards foundation models and few-shot parameter-efficient fine-tuning for volumetric organ seg- mentation,","venue":null,"work_id":"8be5a153-bab5-4f53-add8-4f551c36773c","year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.123971Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:73f300f27afa06505526c04222e3e4404019a5fcebaae3709e433c65fdf8beac","observation_id":"12073882-8e25-47fa-b8f3-13c49385940a","resolution":{"observed_at":"2026-08-07T05:02:21.525535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11866","last_updated":"2023-03-21T14:12:08Z","snapshot_observed_at":"2026-08-18T10:40:51.997365Z","submitted_at":"2023-03-21T14:12:08Z","title":"Contrastive Alignment of Vision to Language Through Parameter-Efficient Transfer Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11866","snapshot_observed_at":"2026-08-07T05:02:21.128128Z","title":"Contrastive alignment of vision to language through parameter-efficient transfer learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.128128Z"},"links":{"cited_paper":"/paper/2303.11866","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:c118d17e1dfd178e9667ce592729f7339751f25a6e8e21426d7fff387785453e","observation_id":"fd6089af-958e-43a2-98df-a43146bd29da","resolution":{"observed_at":"2026-08-07T05:02:21.128128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.504899Z","title":"Scaling language- image pre-training via masking,","venue":null,"work_id":"f090ec33-254a-454f-8796-15fd660f585c","year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.132633Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:a4c2d0093bd465dcbc5a5fee721d5f96dd5b944e1bf84e01e63eee53c9c47b83","observation_id":"dfda98a6-9006-4d5c-a902-26e0b1555765","resolution":{"observed_at":"2026-08-07T05:02:21.509160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.136469Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.136469Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:459f3a5d7e1ecb16bc40228f10b23a98bfdfa16e7cf0ce59a72c866c24c2cba3","observation_id":"677245e6-b7da-4913-b2a4-b271c50526f2","resolution":{"observed_at":"2026-08-07T05:02:21.136469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-07T05:02:21.140339Z","title":"Gaussian error linear units (gelus),","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.140339Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:a9ab612b8e1ffbf5a5b3ceba45bfe417d3ba5abe15ad682a155d8375c3df0fbb","observation_id":"e36c3afa-c4bb-4bf9-af8b-6324a2c96d89","resolution":{"observed_at":"2026-08-07T05:02:21.140339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.481078Z","title":"Mvco- dot: Multi-view contrastive domain transfer network for medical report generation,","venue":null,"work_id":"9da5e026-e93e-46e7-ba36-cbfba48a5230","year":2023},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.144569Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:2bbc2f57d055771ed8a0e4beaea7f6a6fb56c8aa1a30406d1aad747e7bfe7306","observation_id":"56ec48d9-6ab1-429d-8320-7828089505f6","resolution":{"observed_at":"2026-08-07T05:02:21.485757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T05:02:21.149064Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.149064Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:674d9efa68991a736340414cce7af1910c07367016d98071d214a0dc249d2afa","observation_id":"88e534ca-45b7-4aef-b061-c2390706973e","resolution":{"observed_at":"2026-08-07T05:02:21.149064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.463738Z","title":"Augmenting the national institutes of health chest radiograph dataset with expert annotations of possible pneumonia,","venue":null,"work_id":"2bbffb90-3378-41b4-a35b-a2d6296bdd6c","year":2019},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.153308Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:b386d3e8e8b539d5ac4d5df770439a79b516d22e9553ee3cf5faed58dc556048","observation_id":"ed74d849-4d17-493c-90d0-3a5ca81c09aa","resolution":{"observed_at":"2026-08-07T05:02:21.470237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.10042","last_updated":"2021-04-12T20:41:48Z","snapshot_observed_at":"2026-08-19T15:31:50.649321Z","submitted_at":"2020-10-20T05:42:47Z","title":"Improving Factual Completeness and Consistency of Image-to-Text Radiology Report Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.10042","snapshot_observed_at":"2026-08-07T05:02:21.157303Z","title":"Im- proving factual completeness and consistency of image-to-text radiology report generation,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.157303Z"},"links":{"cited_paper":"/paper/2010.10042","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:529d189a3dd34fc5742d141db15a51f263e54d7fa20d3eb31c1dbeb119591f4d","observation_id":"c3d7a77f-16a5-4936-be96-df9a5d821719","resolution":{"observed_at":"2026-08-07T05:02:21.157303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:02:21.161272Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.161272Z"},"links":{"citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:8092ec0e0e3dd0cc64e4bf012522df633f29a61a334e3194e58f70b4417bfcff","observation_id":"01006229-228d-4ad5-9916-e3da28397fdb","resolution":{"observed_at":"2026-08-07T05:02:21.161272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T05:02:21.165503Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:02:21.165503Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.08990"},"observation_digest":"sha256:e6162d05ec0796387de83f0aa1a1a7a5397ac0c722d78f4cc77903b5ae0198ad","observation_id":"75493d61-a82c-408a-8cd7-dfe7fe39055b","resolution":{"observed_at":"2026-08-07T05:02:21.165503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08990","last_updated":"2025-06-10T17:02:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T09:30:55.916053Z","submitted_at":"2025-06-10T17:02:27Z","title":"Efficient Medical Vision-Language Alignment Through Adapting Masked Vision Models"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":27},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2506.08990."}