{"as_of":"2026-08-18T19:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:25959c7c901f80dd77cdb78cd927d584bebd468f3f7fd731bfa0ad407654b1c7","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:19:54.253838Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.15929/citation-record","integrity":"/paper/2504.15929/integrity","json":"/paper/2504.15929/citation-record.json","paper":"/paper/2504.15929"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.965152Z","title":"Robust stochastic neural ensemble learning with noisy labels for thoracic disease classification","venue":null,"work_id":"7491a971-8577-4d26-a4af-822844b6d25b","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:53.980929Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:9c7ae6cae4aef5f6f14e7d872c9e14e03358246612cd8a496e7fecd4444070f6","observation_id":"95ae434c-33db-47d3-a027-9dab2258c2cd","resolution":{"observed_at":"2026-08-16T11:19:54.967965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.958012Z","title":"Dawidowicz, E","venue":null,"work_id":"7f7b776f-2489-4128-9b85-0b1c41e87816","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:53.984593Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:a84e45554e125278eec312c8fe88ebc196f3b53bbed902403118a2d14f110024","observation_id":"0b9b2160-30e3-4c44-8b4d-c4c1deeef0d8","resolution":{"observed_at":"2026-08-16T11:19:54.961171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.948812Z","title":"Dynamic graph enhanced contrastive learning for chest x-ray report generation","venue":null,"work_id":"e9b39769-5518-4851-90a4-be8c4989b26c","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:53.988678Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:09d74d04f25fc61660ff591da6d73da11eb5ecdad3654b6c6d1d650142a440b2","observation_id":"0a05d9fc-cc50-424b-85b4-1b24c26ca417","resolution":{"observed_at":"2026-08-16T11:19:54.952105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.939183Z","title":"Miter: Medical image–text joint adaptive pretraining with multi-level contrastive learning","venue":null,"work_id":"7ba1b83f-189e-47fb-80d2-54d262115e46","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:53.991664Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:89172e20513dd17b1391be04defa0918518672b1ac003fbbf61fdb13dcda92e2","observation_id":"4ecb78ce-541e-417c-9693-bb0bfe92ee29","resolution":{"observed_at":"2026-08-16T11:19:54.942678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.932461Z","title":"Vision-language models for radiology AI","venue":null,"work_id":"eb872c8d-790f-4502-a439-d90688c89f9e","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:53.994643Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:6ff9b74f7ab5e8aa7133c605a97884b9525d34f983300451e674ee73f8f3e95f","observation_id":"352daccd-d6ff-4bc2-bee3-f6b492ebf0d7","resolution":{"observed_at":"2026-08-16T11:19:54.934783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.925752Z","title":"Automated radiographic report generation purely on transformer: A multicriteria supervised approach","venue":null,"work_id":"8b26f1f5-efd3-4f2f-b625-d00f9d821d74","year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:53.997679Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:54bb79bd8d8202a76e6c1e9d7dbae65733350375fc7a37b29d963621065b3917","observation_id":"596bf4ce-e730-42b0-9445-d833dd1dfb38","resolution":{"observed_at":"2026-08-16T11:19:54.928503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.919305Z","title":"Chestxraybert: A pretrained language model for chest radiology report summarization","venue":null,"work_id":"5f0411c8-4b1e-44c4-8266-6fff13721800","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.000554Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:68755fc188dca74f4de4f75cf9d167358ba2660e75b03ee854a47472082fb857","observation_id":"59886bd7-7cdb-48b9-aa68-3812f75ccbfd","resolution":{"observed_at":"2026-08-16T11:19:54.921796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.912597Z","title":"Veasey and Amir A","venue":null,"work_id":"ca09822b-79b3-4972-85e9-4329b8c6f56a","year":2025},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.003474Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:e607edbbf623f14b121ae57a154f853995fdb33dccba9a241e8438e9fc6c4c76","observation_id":"816b93f7-812c-4e26-92b0-9e78b82497e9","resolution":{"observed_at":"2026-08-16T11:19:54.915461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.906379Z","title":"Castro, Benedikt Boecking, Harshita Sharma, Kenza Bouzid, Anja Thieme, Anton Schwaighofer, Maria Wetscherek, Matthew P","venue":null,"work_id":"0948d986-91a7-4fc0-bb58-6a4a45222f80","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.005547Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:00fe0f16abb76d8572f39976f439eff4befa4c374502b1949fdf3c194aa38272","observation_id":"8ea78d50-1ef8-4cff-8cfa-69a1f3276598","resolution":{"observed_at":"2026-08-16T11:19:54.908726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.899824Z","title":"O’Neil, and Sotirios A","venue":null,"work_id":"5a6a74a8-29ac-4545-beff-a2d034435d08","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.007726Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:2902b3fcbc41e9485e23c3b71a7858971dad1d23408be7fc2d5d5f85c6f3b23b","observation_id":"637f6442-71ae-415c-b13f-9b72478ee409","resolution":{"observed_at":"2026-08-16T11:19:54.902146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.893087Z","title":null,"venue":null,"work_id":"1d4a5159-899c-494a-8d05-c016769d63f8","year":2025},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.010042Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:f5f3fc3b155b9f0491eb1218f07f03ce8b4cc54895ff73ee10f5b590e697f560","observation_id":"3e8e2d93-7d14-4d61-b2a4-4fc22bf0f317","resolution":{"observed_at":"2026-08-16T11:19:54.895948Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.885509Z","title":"Lungren, Hoifung Poon, and Akshay S Chaudhari","venue":null,"work_id":"07f5cd68-5369-4af8-8c65-0e58ea433b7c","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.012342Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:dea3a535eb45802d66db570a7b696122b00af6ab8923b65039e8d0b128e07540","observation_id":"62b0b60c-389b-49af-8c60-db5db267ffa7","resolution":{"observed_at":"2026-08-16T11:19:54.888370Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.878117Z","title":"Joint learning of localized representations from medical images and reports","venue":null,"work_id":"c77c2305-1bfc-4939-970a-136ff2373911","year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.014730Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:289289973be1b4bbe676295a038b89768536f0595a34af21cc53728bfc21ca29","observation_id":"822ef058-ad5b-4019-986d-6afe6266d201","resolution":{"observed_at":"2026-08-16T11:19:54.880934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.868636Z","title":"Castro, Anton Schwaighofer, Stephanie Hyland, Maria Wetscherek, Tristan Naumann, Aditya Nori, Javier Alvarez-Valle, Hoifung Poon, and Ozan Oktay","venue":null,"work_id":"8a7502cb-0947-4c32-935e-b79d0e7ee726","year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.017015Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:7a21fcd0e886a6b177ad89ef1a703b39237d0ee2fa2bcabc1fd2e69c2077a76f","observation_id":"9b074428-8de4-4d70-977b-593476dad94a","resolution":{"observed_at":"2026-08-16T11:19:54.873297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.860422Z","title":"Mapping medical image-text to a joint space via masked modeling","venue":null,"work_id":"8c0c7618-4772-4960-a846-3570e8214efb","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.019184Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:61a784f6e581c4bd894d053403f465f456abf8b2e36edd6d89827ef4133c50a5","observation_id":"6d067c51-dacd-4aa4-aa2d-9a0668d1df2f","resolution":{"observed_at":"2026-08-16T11:19:54.863667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01583","last_updated":"2024-02-26T10:35:03Z","snapshot_observed_at":"2026-08-16T14:30:10.226292Z","submitted_at":"2024-01-03T07:22:54Z","title":"Enhancing Representation in Medical Vision-Language Foundation Models via Multi-Scale Information Extraction Techniques","version":2},"cited_work":{"arxiv_id":"2401.01583","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.01583","snapshot_observed_at":"2026-08-16T11:19:54.561606Z","title":"Enhancing Representation in Medical Vision-Language Foundation Models via Multi-Scale Information Extraction Techniques","venue":"cs.CV","work_id":"61d8d956-4e1e-42a1-ae99-993a3f255c55","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.021205Z"},"links":{"cited_paper":"/paper/2401.01583","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:612ca8b72604e936b6193b4594cda04788650b8966c667c7d20a494e2e663c5e","observation_id":"04865055-7b8f-487a-91f6-e7cbb146cbb2","resolution":{"observed_at":"2026-08-16T11:19:54.564876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11352","last_updated":"2023-02-22T12:53:33Z","snapshot_observed_at":"2026-08-18T08:18:10.125818Z","submitted_at":"2023-02-22T12:53:33Z","title":"X-TRA: Improving Chest X-ray Tasks with Cross-Modal Retrieval Augmentation","version":1},"cited_work":{"arxiv_id":"2302.11352","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.11352","snapshot_observed_at":"2026-08-16T11:19:54.550863Z","title":"X-TRA: Improving Chest X-ray Tasks with Cross-Modal Retrieval Augmentation","venue":"cs.CV","work_id":"fa4d0cd1-c543-43e3-9d95-39c495709d20","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.024184Z"},"links":{"cited_paper":"/paper/2302.11352","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:86384823ce2e6319101bcd93b9c0645cf139e0762854331981386c8d5177c333","observation_id":"3b66ec60-b9b8-4788-b2ab-e1b39bbc0e43","resolution":{"observed_at":"2026-08-16T11:19:54.554556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10501","last_updated":"2025-02-07T09:52:01Z","snapshot_observed_at":"2026-08-17T22:20:08.396121Z","submitted_at":"2024-01-19T05:28:51Z","title":"Enhancing medical vision-language contrastive learning via inter-matching relation modelling","version":2},"cited_work":{"arxiv_id":"2401.10501","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.10501","snapshot_observed_at":"2026-08-16T11:19:54.541479Z","title":"Enhancing medical vision-language contrastive learning via inter-matching relation modelling","venue":"cs.CV","work_id":"f39649ab-25d0-4f80-9d8f-fc58d505bcda","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.027135Z"},"links":{"cited_paper":"/paper/2401.10501","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:432977665cd45d422a6e7dc8091d44adc0823aa5588445f50829ae1cc2fac37c","observation_id":"19ae9c0f-ab33-4317-9dd3-600267ed1410","resolution":{"observed_at":"2026-08-16T11:19:54.544422Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.851212Z","title":"Cross-modal prototype driven network for radiology report generation","venue":null,"work_id":"bbd081b5-cde3-4362-a87f-51e02cf98c07","year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.029750Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:e7f891dcefcc876f6814352b21e6cd1a07d133863c04d254bf102986ee342379","observation_id":"8220db20-d61a-4e91-804d-80c99dad23fb","resolution":{"observed_at":"2026-08-16T11:19:54.854276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.843721Z","title":"Semantic extension for cross-modal retrieval of medical image-diagnosis report","venue":null,"work_id":"436715d9-2e7a-4f4d-b200-bb5892442d99","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.031874Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:3b2e937143a70ccb409cd41208c3d0bbf00bd0638d8ad2609cb624c56bc18f8a","observation_id":"103a92f6-78a6-4a8b-b33f-2788b30e4b18","resolution":{"observed_at":"2026-08-16T11:19:54.846181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.835380Z","title":"Fine-grained medical vision-language representation learning for radiology report generation","venue":null,"work_id":"ce649148-3b88-4b52-bc07-bb069712f420","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.035428Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:2a2b3479bf534b22b0221b2167ca7671f9078e14db55b326932d2a706f9630e0","observation_id":"e688590a-7fbf-4f45-8885-b12f532715cf","resolution":{"observed_at":"2026-08-16T11:19:54.837718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.828481Z","title":"Exploring vision language pretraining with knowledge enhancement via large language model","venue":null,"work_id":"5d8cfcb1-73c3-40e9-8fd1-afd77bfae132","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.038485Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:595ed788107f37facc4e39dd5957d9a4dc32586bd4ff42390d3e3c06a0e35a72","observation_id":"8e6fc0d6-d164-4dc2-a8f7-6f3383aefa55","resolution":{"observed_at":"2026-08-16T11:19:54.831780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.822063Z","title":"Manning, and Curtis P","venue":null,"work_id":"2f76ce21-9cef-4100-8161-b7bc04c37c4c","year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.040744Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:3d2e35c9e7fc241adca8ec409264117ca81d9d18e28f28d7d29ea4ec3e1a7e44","observation_id":"263b48aa-4b65-4e25-a02a-bdb5ab8cfa5d","resolution":{"observed_at":"2026-08-16T11:19:54.824389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.814363Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"900452ac-501d-485e-82b3-3372505630a7","year":2021},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.043004Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:22737b52d1af95a69732e1cb3e721d97659c48a4258241373fc92022d64c4932","observation_id":"bf0d6496-9546-471d-b486-6613070fa3af","resolution":{"observed_at":"2026-08-16T11:19:54.817162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.807277Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"e34f8326-f191-4079-b759-5968797f5a14","year":2021},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.045181Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:9e7900ba8a97f127dc6f4ea59ab6edae37d845881e70717a045c0c03b49d580a","observation_id":"91d29367-be39-4e58-b666-f69fc8e7df49","resolution":{"observed_at":"2026-08-16T11:19:54.810147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.799042Z","title":"Deep visual-semantic alignments for generating image descriptions","venue":null,"work_id":"7e32aabe-1595-4ddf-b14b-48d2a25267c1","year":2015},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.048081Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:55e466114171d38395219f1dd8168ef28c8cf9b8d2e6499e75cda62a89d6b034","observation_id":"2dc0d730-923d-495d-8e83-a907ca1728ae","resolution":{"observed_at":"2026-08-16T11:19:54.801781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.05612","last_updated":"2018-07-29T19:11:57Z","snapshot_observed_at":"2026-08-14T20:46:56.185352Z","submitted_at":"2017-07-18T13:51:32Z","title":"VSE++: Improving Visual-Semantic Embeddings with Hard Negatives","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.05612","snapshot_observed_at":"2026-08-16T11:19:54.051316Z","title":"Vse++: Improving visual-semantic embed- dings with hard negatives","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.051316Z"},"links":{"cited_paper":"/paper/1707.05612","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:0e27d9a94c87625b3482ac0c7d210096b68186a76fb1c3335ba571529cd4df22","observation_id":"59b3be12-b7fd-4ee0-b7a3-69a642f52f82","resolution":{"observed_at":"2026-08-16T11:19:54.051316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12208","last_updated":"2024-12-18T20:56:18Z","snapshot_observed_at":"2026-08-16T14:25:27.106074Z","submitted_at":"2024-01-22T18:51:07Z","title":"A Vision-Language Foundation Model to Enhance Efficiency of Chest X-ray Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12208","snapshot_observed_at":"2026-08-16T11:19:54.054240Z","title":"Tsai, Andrew Johnston, Cameron Olsen, Tanishq Mathew Abraham, Sergios Gatidis, Akshay S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.054240Z"},"links":{"cited_paper":"/paper/2401.12208","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:bb46eabfc5afead48e85d20ffafaf1d09169c4a172c23e83c4f0d6f1f3c39eba","observation_id":"1e6cb07a-bf17-4c4d-b22c-6df74011c9c7","resolution":{"observed_at":"2026-08-16T11:19:54.054240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.791521Z","title":"Harnessing the power of pre-trained vision-language models for efficient medical report generation","venue":null,"work_id":"9c03aff2-20d1-466b-bbf9-b82e98b0fa82","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.057667Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:1e828ad46f3431bc32a060a00b0d555062abfb71423b852146beefad47e82767","observation_id":"fa9e114b-26aa-4045-8f0a-13699128deda","resolution":{"observed_at":"2026-08-16T11:19:54.794135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.16022","last_updated":"2021-03-30T01:48:46Z","snapshot_observed_at":"2026-08-16T18:35:22.271462Z","submitted_at":"2021-03-30T01:48:46Z","title":"Self-supervised Image-text Pre-training With Mixed Data In Chest X-rays","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.16022","snapshot_observed_at":"2026-08-16T11:19:54.060468Z","title":"Self-supervised Image-text Pre-training With Mixed Data In Chest X-rays","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.060468Z"},"links":{"cited_paper":"/paper/2103.16022","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:e7ca85226c362cbeb7b8a69162a51ee11075d175a14443fa6325d9bbecf3bb27","observation_id":"c987a717-8fcf-49d0-9540-4765b001de56","resolution":{"observed_at":"2026-08-16T11:19:54.060468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.784739Z","title":"Multi-Granularity Cross-modal Alignment for Generalized Medical Visual Representation Learning","venue":null,"work_id":"32177151-551d-45d0-aee8-fbeda6396826","year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.063746Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:fe018d883245053c2e621da7bc61fc2622ccd150a6f8aa1ba7dc5349e7958804","observation_id":"ce69ba26-2ed2-4c36-a198-a63dba98a84e","resolution":{"observed_at":"2026-08-16T11:19:54.787551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19894","last_updated":"2024-02-17T19:49:54Z","snapshot_observed_at":"2026-08-16T15:27:54.860103Z","submitted_at":"2023-05-31T14:28:19Z","title":"Med-UniC: Unifying Cross-Lingual Medical Vision-Language Pre-Training by Diminishing Bias","version":3},"cited_work":{"arxiv_id":"2305.19894","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.19894","snapshot_observed_at":"2026-08-16T11:19:54.513166Z","title":"Med-UniC: Unifying Cross-Lingual Medical Vision-Language Pre-Training by Diminishing Bias","venue":"cs.CL","work_id":"be58d4aa-e1cf-46ce-81f0-dbc3ec785ba7","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.067399Z"},"links":{"cited_paper":"/paper/2305.19894","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:f31a14dab1f533c359a8a572a106d94b10f794471d66deee72508c27bb22299d","observation_id":"04fbedde-df51-40fa-a380-d11c65db51d0","resolution":{"observed_at":"2026-08-16T11:19:54.516730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.069886Z","title":"Nezhad, Gokberk Elmas, Bilal Kabas, Fuat Arslan, and Tolga C ¸ ukur","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.069886Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:2136c50a7f68622b7d18af69f2f9c15654ca16d9ee0755bd85bb94b14d258eb5","observation_id":"715ac64d-7b9a-46e3-bf05-4d29052adfb3","resolution":{"observed_at":"2026-08-16T11:19:54.069886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.072341Z","title":"Atli, Bilal Kabas, Fuat Arslan, Arda C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.072341Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:81553165e3b7064f5d361103b503f5624d751b9f4866bcfc91f6ec65b8bbb0a3","observation_id":"b91720ef-3362-4928-918d-41f25c599726","resolution":{"observed_at":"2026-08-16T11:19:54.072341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.777852Z","title":"Cxr-llava: a multimodal large language model for interpreting chest x-ray images","venue":null,"work_id":"b9e88f52-15e2-4ea8-846c-c4b95b9f8598","year":2025},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.074547Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:cba24fa8ccdde66baf0f8c8259a7409d1ab32f9ec9e92b204f5a0bf81bf4c47b","observation_id":"7e636866-b002-4457-bdb9-642ce2a535de","resolution":{"observed_at":"2026-08-16T11:19:54.780369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.769930Z","title":"Collaboration between clinicians and vision– language models in radiology report generation","venue":null,"work_id":"74f87502-a1bc-465c-9490-78ba6badbe23","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.077685Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:b310e2d72fb0e26d93876103614cf1a76d084b5ea74270bc075ebb449a21b01e","observation_id":"88bd5a35-bc10-4839-8124-6d04c85e81e5","resolution":{"observed_at":"2026-08-16T11:19:54.773077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.762112Z","title":"Jay Kuo, Aichi Chien, and Kai-Wei Chang","venue":null,"work_id":"3178196e-3e12-402e-a2f1-849815045862","year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.081070Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:5b287846cea6bc78b4a8b6b50dd95ffe7b6159848f1756a267d3924846bbd924","observation_id":"9507fc57-73b6-42d6-a7ba-d092e10814a1","resolution":{"observed_at":"2026-08-16T11:19:54.764598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.754214Z","title":"Self-supervised multi-modal training from uncurated images and reports enables monitoring ai in radiology","venue":null,"work_id":"9738289d-4810-418f-9d6f-1fee7133950e","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.083228Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:1cae9fdb108b5956ee8fd4f382d8236d0cb776683b080415898d71619bdeb144","observation_id":"3d35144e-0ad6-41fd-9115-6e1031931dba","resolution":{"observed_at":"2026-08-16T11:19:54.757563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.744835Z","title":"Medklip: Medical knowledge enhanced language-image pre-training for x-ray diagnosis","venue":null,"work_id":"81f5138f-782b-4426-8975-314abe165c64","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.085919Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:369abb8cdc69253771137f7b1067ba4a8a7f4eabbaad9075703b788a5ab9b2a8","observation_id":"e80f701c-4f06-4dbc-8483-93d1d14de454","resolution":{"observed_at":"2026-08-16T11:19:54.748874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.734545Z","title":"Knowledge-enhanced visual-language pre-training on chest radiology images","venue":null,"work_id":"cb9bc220-b40a-4bf1-940f-7409e2831177","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.088667Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:c6b67c97300462a25a1270939946e1fb7f722bf42f54ac567a54d5897775478d","observation_id":"a61f7804-7bce-42ef-997b-9f35786ae6bc","resolution":{"observed_at":"2026-08-16T11:19:54.737359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.726379Z","title":"Improving medical vision-language contrastive pretraining with semantics-aware triage","venue":null,"work_id":"20553f4a-728e-4b41-88fd-d22e534124d7","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.091182Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:b9af48cc9fb3a83e027b263a5a86a1d009e963e5ab27741bee5b118630ca5e7d","observation_id":"c40a7be3-00c0-449f-be7e-4d9468f753fe","resolution":{"observed_at":"2026-08-16T11:19:54.729858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.715983Z","title":"Lungren, and Serena Yeung","venue":null,"work_id":"885f0d6c-3d86-41e3-b4ea-85ac2e8e5ce8","year":2021},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.093829Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:1de4f9eb88680cdc3e7c6d5ef17b9290662d9f22f4670be7379a680003bb0f76","observation_id":"7af6b796-b806-4c48-8b8d-86d703aad524","resolution":{"observed_at":"2026-08-16T11:19:54.719552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.708266Z","title":"A contrastive triplet network for automatic chest x-ray reporting","venue":null,"work_id":"1f6d594f-06aa-4cbf-bc55-6504f8d595ec","year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.096705Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:4e986d9c963e5fc37f9ed80b43ac07efa7f6e13cc807120b06fa8d462d777d44","observation_id":"a9ded3ad-f45d-4d63-abee-9f691e80aa4c","resolution":{"observed_at":"2026-08-16T11:19:54.711054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07027","last_updated":"2024-04-30T12:37:13Z","snapshot_observed_at":"2026-08-16T14:53:16.952090Z","submitted_at":"2023-10-10T21:29:41Z","title":"Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07027","snapshot_observed_at":"2026-08-16T11:19:54.099736Z","title":"Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.099736Z"},"links":{"cited_paper":"/paper/2310.07027","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:f89e9aec57344c9a67bb339214803bcbc0ec9fb839d118e25aa16345e11fda3c","observation_id":"40b58e1a-b442-48d4-889f-1d74d7bad7df","resolution":{"observed_at":"2026-08-16T11:19:54.099736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01591","last_updated":"2024-01-03T07:54:13Z","snapshot_observed_at":"2026-08-18T08:18:18.147442Z","submitted_at":"2024-01-03T07:54:13Z","title":"MLIP: Medical Language-Image Pre-training with Masked Local Representation Learning","version":1},"cited_work":{"arxiv_id":"2401.01591","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.01591","snapshot_observed_at":"2026-08-16T11:19:54.309253Z","title":"MLIP: Medical Language-Image Pre-training with Masked Local Representation Learning","venue":"cs.CV","work_id":"c8a508e0-47da-4716-a90f-6fb1003c5a06","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.102346Z"},"links":{"cited_paper":"/paper/2401.01591","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:06c4259631a32c8c34f631bab142b6d6065bc65a10ab42162e5f1f251f0abb56","observation_id":"ad878bb2-5827-41d3-a631-7e07ecf2511b","resolution":{"observed_at":"2026-08-16T11:19:54.313708Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.698211Z","title":"Visual prior-based cross- modal alignment network for radiology report generation","venue":null,"work_id":"6d63100a-3ca3-4fea-a6f0-bebf64791079","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.104858Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:2268dbb12393af5df3640cef52efece5ed74656dba2269ca881b647d748a7280","observation_id":"990da4b8-2ad1-4be9-9d57-08e6b97f01d1","resolution":{"observed_at":"2026-08-16T11:19:54.701517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.689136Z","title":"Unify, align and refine: Multi-level semantic alignment for radiology report generation","venue":null,"work_id":"e78cbb4a-ab72-4239-8f1a-111a0d85fd00","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.108084Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:b592048f5bc537c337a6fd66cfcc5308a31c4c5cc23fdd87de77bb6ad11ff1f6","observation_id":"25f3f929-da01-4183-a34e-8106aa9494ca","resolution":{"observed_at":"2026-08-16T11:19:54.692405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.680770Z","title":"Vision-language models for vision tasks: A survey","venue":null,"work_id":"ab6acb3f-cc74-451b-b08b-acc9f66275ee","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.110278Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:60d2cfadf86aeda848d6a8a274f0d26588ea7fef05b7ccfdcd78637b086eed7f","observation_id":"baf9c301-f8dd-4bc3-82b5-625680e6e609","resolution":{"observed_at":"2026-08-16T11:19:54.683552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10163","last_updated":"2022-10-18T21:06:29Z","snapshot_observed_at":"2026-08-16T16:23:03.490700Z","submitted_at":"2022-10-18T21:06:29Z","title":"MedCLIP: Contrastive Learning from Unpaired Medical Images and Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10163","snapshot_observed_at":"2026-08-16T11:19:54.112689Z","title":"MedCLIP: Contrastive Learning from Unpaired Medical Images and Text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.112689Z"},"links":{"cited_paper":"/paper/2210.10163","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:80d6f14b14f892c0868bf9fd534ec282285a0222855a69f94e5ae73527b604e9","observation_id":"7ffb0fba-852b-4a7e-bd28-250ad8fd5667","resolution":{"observed_at":"2026-08-16T11:19:54.112689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09294","last_updated":"2024-03-14T11:29:47Z","snapshot_observed_at":"2026-08-16T14:09:52.937942Z","submitted_at":"2024-03-14T11:29:47Z","title":"Anatomical Structure-Guided Medical Vision-Language Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09294","snapshot_observed_at":"2026-08-16T11:19:54.115544Z","title":"Anatomical Structure-Guided Medical Vision-Language Pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.115544Z"},"links":{"cited_paper":"/paper/2403.09294","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:c9316d25d88b3e10a8d58203c0674eb15104d78962bf59be2a999b8a371f32e1","observation_id":"88614648-9708-4979-a726-5ca6fbf0e6c6","resolution":{"observed_at":"2026-08-16T11:19:54.115544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.670396Z","title":"KIA: Knowledge-guided implicit vision- language alignment for chest X-ray report generation","venue":null,"work_id":"69b15afd-97e9-480a-a552-cb1ca159c8a5","year":2025},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.118468Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:578b9bbb4a4f73bd9ad09dad9a32146cbd68807f2516c9fde1adcffa278112ab","observation_id":"1692ab31-0c57-4df6-8b5c-1b1eae0a2e6f","resolution":{"observed_at":"2026-08-16T11:19:54.673950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.662413Z","title":"Content-based medical image retrieval with opponent class adaptive margin loss","venue":null,"work_id":"37e9c53f-b6df-453c-98f6-38348f0b3bb0","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.121012Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:5e0acbb3f34ac33c5011d0537f0c84d2dfdf5b07edda21abfd29bd0c8c7f0cd5","observation_id":"ef268630-8f9a-4f6c-8bca-9eefd3617731","resolution":{"observed_at":"2026-08-16T11:19:54.665025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.655264Z","title":"Improving joint learning of chest X-Ray and radiology report by word region alignment","venue":null,"work_id":"e822e46c-3486-4701-9729-184cbd876345","year":2021},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.123973Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:9e174a67ce6541bb79070f7bfef109488199798e60251c8dab4d6fe568955492","observation_id":"05c7e3ea-7f54-4030-91ce-4e4610e41956","resolution":{"observed_at":"2026-08-16T11:19:54.657756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10185","last_updated":"2026-04-27T07:59:24Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:14:22Z","title":"Detecting and Evaluating Medical Hallucinations in Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10185","snapshot_observed_at":"2026-08-16T11:19:54.127733Z","title":"Detecting and Evaluating Medical Hallucinations in Large Vision Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.127733Z"},"links":{"cited_paper":"/paper/2406.10185","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:b92d4c8de0631798384f2efeef6cdb6b634ed366809175d40fe6f210287a9d5d","observation_id":"6b7b1299-3788-473c-a65b-a1d1cfe74d6e","resolution":{"observed_at":"2026-08-16T11:19:54.127733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.647156Z","title":"Ontology-based data integration between clinical and research systems","venue":null,"work_id":"f316be64-506c-4519-afa1-313fee719148","year":2015},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.130137Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:4109b21dd1625080d63317056c5c21209c3345fc9b7a2a21163255b8adaae4d8","observation_id":"994633d0-e569-4967-b77a-2f5fe4543cc0","resolution":{"observed_at":"2026-08-16T11:19:54.649689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.639671Z","title":"Chexpert: A large chest radiograph dataset with uncer- tainty labels and expert comparison","venue":null,"work_id":"117fb1dc-8acc-44a4-a1d6-c96b943b82fc","year":2019},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.132287Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:da1de3f71d6bb773ced1b6bc2605a3624b64578bfb6066e7393874aff338830b","observation_id":"474d8eaf-cfd4-4917-9278-fa0596db1d54","resolution":{"observed_at":"2026-08-16T11:19:54.642121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.632298Z","title":"On the role of morphological information for contextual lemmatization","venue":null,"work_id":"f2ec8816-72e8-4853-9daa-7f175592913f","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.134875Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:0d6d65583a4ad1817c5229fe64e4372ffd78fd5f9eedea3318a44e5e529ad7a5","observation_id":"365595c1-7051-47b4-8173-a45da7969305","resolution":{"observed_at":"2026-08-16T11:19:54.634982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.623575Z","title":"Optimizing the dice score and jaccard index for medical image segmentation: Theory and practice","venue":null,"work_id":"1f6e13e4-79e7-4092-b966-b8c84e7e37b1","year":2019},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.138530Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:9dfdeec546aedbeecf9d57e2ed58203f1dbc83055741544727f636f9bb144ca3","observation_id":"853646e6-4b31-4e4b-becf-16b540b926fa","resolution":{"observed_at":"2026-08-16T11:19:54.627066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-16T11:19:54.141249Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.141249Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:5bb7f85cd35887bd25909a2de0d9e78a3b7b08a2cbbe0786f11cb574e50db5ee","observation_id":"387cac0d-ccb1-490e-b716-3672f5ca0f69","resolution":{"observed_at":"2026-08-16T11:19:54.141249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.615009Z","title":"Spd manifold deep metric learning for image set classification","venue":null,"work_id":"2266c295-2703-4b7c-9373-342e7d7151cc","year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.144203Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:a1b8f35abf9416df00065e62bfdfbd607377b598e238d87fc727da30d0a15648","observation_id":"fed4adc1-0a1d-453a-b87d-df9056fce35a","resolution":{"observed_at":"2026-08-16T11:19:54.617528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.607877Z","title":"Mimic-cxr, a de-identified publicly available database of chest radiographs with free-text reports","venue":null,"work_id":"22bdffec-37ff-41e5-b0a8-82c382089b0e","year":2019},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.232135Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:caf4c6c341f52caefa7c19ef3e438c9f70a91c35543378fe40e93a76b4ce0890","observation_id":"d02e1505-b337-49fb-9cdc-e38fa8df57ff","resolution":{"observed_at":"2026-08-16T11:19:54.610369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.600359Z","title":"Wu, Safwan S","venue":null,"work_id":"64974557-9182-42fb-9ee6-e1f01418e96e","year":2019},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.235026Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:db60644f559eeccd1adf3a486cc22884eb1ed8f9406b498179ba5ccd1df6a5e3","observation_id":"a879af72-761c-4cbb-86fc-a5171b1ffab0","resolution":{"observed_at":"2026-08-16T11:19:54.603576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.03323","last_updated":"2019-06-20T20:41:58Z","snapshot_observed_at":"2026-08-14T16:50:51.644744Z","submitted_at":"2019-04-06T00:34:39Z","title":"Publicly Available Clinical BERT Embeddings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.03323","snapshot_observed_at":"2026-08-16T11:19:54.238249Z","title":"Murphy, Willie Boag, Wei-Hung Weng, Di Jin, Tristan Naumann, and Matthew B","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.238249Z"},"links":{"cited_paper":"/paper/1904.03323","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:9896d719976b39d594f0559ace747410ee810b01878c8ead45707fc31031cf9e","observation_id":"c4f4229c-0ff5-43b1-9c7d-f2979e4dcb11","resolution":{"observed_at":"2026-08-16T11:19:54.238249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.593626Z","title":"Langlotz, Andrew Y","venue":null,"work_id":"c714296f-5c1e-4f18-a8d5-fe0171511c31","year":2022},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.241569Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:bdb752cf84b0982ef118c8be167973797dec2071ef4309b23eccc2767b99056c","observation_id":"74f90dd6-534f-4680-8e25-3e5f67e589dd","resolution":{"observed_at":"2026-08-16T11:19:54.596329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.585895Z","title":"Medfilip: Medical fine-grained language-image pre-training.IEEE J Biomed Health Inf, 2025","venue":null,"work_id":"2349efd3-62bb-4d91-89b7-47a041d1cf69","year":2025},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.243707Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:326d8ea1686a2f46eae0f2749b6e350d850a93039ca5fa2223fbcfc018624a04","observation_id":"257152dc-0ef7-4635-a7c7-c1297cb3bd8d","resolution":{"observed_at":"2026-08-16T11:19:54.588851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.578210Z","title":"Selvaraju, Michael Cogswell, Abhishek Das, Ramakrishna Vedantam, Devi Parikh, and Dhruv Batra","venue":null,"work_id":"9e052968-7bd1-4957-a759-8776abe71dc1","year":2017},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.246092Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:2a450e462ce98bd7ccb0891dba4e89cdd1102d859e39aa59a663945bfc6fe016","observation_id":"d5d5aae8-200a-49d8-99b3-d6150cd5cdd7","resolution":{"observed_at":"2026-08-16T11:19:54.581272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:19:54.570515Z","title":null,"venue":null,"work_id":"818b7315-ce05-4958-bb70-9b180e6fc45e","year":2023},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.248621Z"},"links":{"citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:9accfc90a5b4d8fea6a2f7d6f8b7a108d025690f9556ef6d5763a4eb4216ef12","observation_id":"8d2e767b-7553-4851-b463-ed6a5eaa9a3a","resolution":{"observed_at":"2026-08-16T11:19:54.573407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06789","last_updated":"2024-05-10T19:39:55Z","snapshot_observed_at":"2026-08-16T13:53:38.242113Z","submitted_at":"2024-05-10T19:39:55Z","title":"Self-Consistent Recursive Diffusion Bridge for Medical Image Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06789","snapshot_observed_at":"2026-08-16T11:19:54.250832Z","title":"Self-consistent recursive diffusion bridge for medical image translation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.250832Z"},"links":{"cited_paper":"/paper/2405.06789","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:c000564ad9ecf1cb30420fe368addf7c299f533f9218b6cd12a9ab20be1ddbc0","observation_id":"c1d13099-d181-47fc-8352-0a67eb8e0f6d","resolution":{"observed_at":"2026-08-16T11:19:54.250832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09331","last_updated":"2025-08-20T21:04:12Z","snapshot_observed_at":"2026-08-15T11:33:25.921792Z","submitted_at":"2024-12-12T14:59:56Z","title":"Physics-Driven Autoregressive State Space Models for Medical Image Reconstruction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09331","snapshot_observed_at":"2026-08-16T11:19:54.253838Z","title":"Nezhad, Saban Ozturk, Emine U","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T11:19:54.253838Z"},"links":{"cited_paper":"/paper/2412.09331","citing_paper":"/paper/2504.15929"},"observation_digest":"sha256:06515acd139817792741884599ef925146ded1394d31516399b6bf81adb3af28","observation_id":"945cc80b-952b-44ca-a50c-b86ae1a8857e","resolution":{"observed_at":"2026-08-16T11:19:54.253838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.15929","last_updated":"2025-04-24T01:26:34Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T18:55:15.063971Z","submitted_at":"2025-04-22T14:17:51Z","title":"Meta-Entity Driven Triplet Mining for Aligning Medical Vision-Language Models"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":5,"verified_fuzzy":48},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2504.15929."}