{"as_of":"2026-08-17T21:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b63850b107e632294453ffa516012938644b2814d56bed66325edf1e8c4d77c0","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T13:58:49.805446Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.13561/citation-record","integrity":"/paper/2604.13561/integrity","json":"/paper/2604.13561/citation-record.json","paper":"/paper/2604.13561"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"a7a331e3-0fb1-4940-9ea5-ef1765936199","year":2021},"citing_paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:49.805446Z"},"links":{"citing_paper":"/paper/2604.13561"},"observation_digest":"sha256:cb0e6d304d4faec2c72728da6745137d8969a950170d4bd31e2230ba5279e572","observation_id":"b13967f2-5868-43ee-8a58-ccaffc36f58d","resolution":{"observed_at":"2026-05-18T19:51:50.833511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":"4cf58539-e12b-4a3d-9d3c-612a397019a0","year":2021},"citing_paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:49.805446Z"},"links":{"citing_paper":"/paper/2604.13561"},"observation_digest":"sha256:4ffc942ac7eb7421bebd29dfb666435b23b8c2ad98c329a1c905cf4a0cdd3b1c","observation_id":"4702c512-9832-4f27-b6be-c6929d300968","resolution":{"observed_at":"2026-05-18T19:51:50.859678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Contrastive learning of medical visual representations from paired images and text","venue":null,"work_id":"c2b35d42-08e1-424e-9d25-b620bcb6f55c","year":2022},"citing_paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:49.805446Z"},"links":{"citing_paper":"/paper/2604.13561"},"observation_digest":"sha256:6427bd411f9fd0db941603f66e58e485310f32cb4bd9c3b8efa30248caf2d58d","observation_id":"62bbe677-aa85-49c9-ba86-e96b53c2ed73","resolution":{"observed_at":"2026-05-18T19:51:50.862502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GLoRIA: A multimodal global-local representationlearningframeworkforlabel-efficientmedicalimagerecognition","venue":null,"work_id":"a037b2ef-48d8-4336-a94f-f9581e0d79ff","year":2021},"citing_paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:49.805446Z"},"links":{"citing_paper":"/paper/2604.13561"},"observation_digest":"sha256:1d8436edce3b18b1c026e3aa007f4a3f5807af61e40a525b85f3038fa1ee920a","observation_id":"5919836b-2db9-469c-9008-55ad67265a19","resolution":{"observed_at":"2026-05-18T19:51:50.842510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mak- ing the most of text semantics to improve biomedical vision-language processing","venue":null,"work_id":"8ac85aa7-28fc-4678-bda4-1220982f025a","year":2022},"citing_paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:49.805446Z"},"links":{"citing_paper":"/paper/2604.13561"},"observation_digest":"sha256:9d34f8c63b0cf4fa8333f6211569703471b81f032f24e70ed14008e68803c8c9","observation_id":"3bec40d3-9901-4fd6-ad5d-d14cef151f45","resolution":{"observed_at":"2026-05-18T19:51:50.839704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Merlin: A vision language foundation model for 3D computed tomography","venue":null,"work_id":"a83b0437-a0f2-465e-881f-de49968f3ac8","year":2024},"citing_paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:49.805446Z"},"links":{"citing_paper":"/paper/2604.13561"},"observation_digest":"sha256:4eccbd8b662138917b2350f779fcc393629159acc6898c25d5d56af75b320e5b","observation_id":"b5228490-9216-4919-a15c-3e5cd2f28d64","resolution":{"observed_at":"2026-05-18T19:51:50.830758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Balanced con- trastive learning for long-tailed visual recognition","venue":null,"work_id":"0c1f8fbd-2027-429b-b778-78f70fb7fab1","year":2022},"citing_paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:49.805446Z"},"links":{"citing_paper":"/paper/2604.13561"},"observation_digest":"sha256:e05b307b8d0fb35518e50de9b53d654ff991312b56264fb84bb88e0f70b6f02e","observation_id":"eaba4fae-42d1-474f-91fa-99688e14c803","resolution":{"observed_at":"2026-05-18T19:51:50.868472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parametric contrastive learning","venue":null,"work_id":"bff6fce1-5167-4315-b42c-9efd2681c7c1","year":2021},"citing_paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:49.805446Z"},"links":{"citing_paper":"/paper/2604.13561"},"observation_digest":"sha256:5a4eb9d55acf462eec8bb9b2ce6a703500ffff2e5742a805e6635b9127618ebd","observation_id":"d179ac1d-c08f-474e-8301-da5e653fe23d","resolution":{"observed_at":"2026-05-18T19:51:50.827976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Contrastive learning with hard negative samples","venue":null,"work_id":"a98c919e-2788-4abe-9a3c-20d3f1146a20","year":2021},"citing_paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:49.805446Z"},"links":{"citing_paper":"/paper/2604.13561"},"observation_digest":"sha256:90627324c913081c9cde025f6d4a08d4c7ca5569c046609d22ad4887440ebd6b","observation_id":"c755be96-a447-43c3-9796-ca606bf9160b","resolution":{"observed_at":"2026-05-18T19:51:50.853437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hard negative mixing for contrastive learning","venue":null,"work_id":"b03a5182-0e60-4588-8ac5-6e8040f9252d","year":2020},"citing_paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:49.805446Z"},"links":{"citing_paper":"/paper/2604.13561"},"observation_digest":"sha256:7a1c3f764bbf637c3a03d725937eaaa794c03361203b6237643d6a5fea927a1b","observation_id":"a7eac4ac-7a45-47cb-9614-b6b3c58c4f43","resolution":{"observed_at":"2026-05-18T19:46:50.549842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"0b546a74-5be7-496f-8be9-48be52b7771f","year":2020},"citing_paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:49.805446Z"},"links":{"citing_paper":"/paper/2604.13561"},"observation_digest":"sha256:a4398ccaa47a0241196920734a9ea4e35bdb1c65326907881e2aa7d3b0bb2da9","observation_id":"306ea2c7-563f-488e-a547-aafa8952523b","resolution":{"observed_at":"2026-05-18T19:51:50.836605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":"e7babe0f-7da4-4c14-9f27-b16511e01d94","year":2020},"citing_paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:49.805446Z"},"links":{"citing_paper":"/paper/2604.13561"},"observation_digest":"sha256:92a7194cb6c95ec8a72ecade91546bdb1013c5f6d1e1720407cd0a0284e58d1b","observation_id":"b06e1f50-b68a-47ef-b8e8-d8f45e12f4b9","resolution":{"observed_at":"2026-05-18T19:51:50.825134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled contrastive learning","venue":null,"work_id":"92e4d836-2a39-461d-be24-05fc629924a5","year":2022},"citing_paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:49.805446Z"},"links":{"citing_paper":"/paper/2604.13561"},"observation_digest":"sha256:a4fe8e83ff07c1da03f5baebfeecba89aea56da9b5ab06cb7b3d6063a0411df8","observation_id":"8a00a620-201d-4567-97fb-c101ee241909","resolution":{"observed_at":"2026-05-18T19:51:50.847955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Expert-level detection of pathologies from unannotated chest X-ray images via self-supervised learning","venue":null,"work_id":"00494696-842d-4af0-8c16-46c7e77e97d7","year":2022},"citing_paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:49.805446Z"},"links":{"citing_paper":"/paper/2604.13561"},"observation_digest":"sha256:e8cf5f86ade4a9c7b1d124fa60b2ee14d9b759b97906f447fc8d4434f6132180","observation_id":"39c01186-d643-4cf3-a9b3-5253b18e7fb1","resolution":{"observed_at":"2026-05-18T19:51:50.850659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Generating CT images from free-form text reports using GANs","venue":null,"work_id":"10451121-5bf6-447c-a8c9-3a9928257cae","year":2024},"citing_paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:49.805446Z"},"links":{"citing_paper":"/paper/2604.13561"},"observation_digest":"sha256:d1ed1a988601bacee7c8e56cb7ac8e0de7b3c665c16cdd100f9f6cae96756389","observation_id":"1c0b6af8-f654-4ad3-9399-07a05f14ba47","resolution":{"observed_at":"2026-05-18T19:51:50.856612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reproducible scaling laws for contrastive language– image learning","venue":null,"work_id":"ae59dc35-3a65-43c2-9c78-a28bc9860267","year":2023},"citing_paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:49.805446Z"},"links":{"citing_paper":"/paper/2604.13561"},"observation_digest":"sha256:79c111ad4a66441aab733b08519b30b39cdfe7411685aafe430de39ca7f56938","observation_id":"51e8502a-2a4f-497d-ba36-fffd7d1982a1","resolution":{"observed_at":"2026-05-18T19:51:50.865335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"eff062c5-a518-4f54-b464-3784ef5c390d","year":2016},"citing_paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:49.805446Z"},"links":{"citing_paper":"/paper/2604.13561"},"observation_digest":"sha256:9ced307d2be40fe444e28cfc69661bfd1f8174aace7e2d824b288e17ee918132","observation_id":"ac39b4b7-dbab-49bb-9924-c227e5ffc80a","resolution":{"observed_at":"2026-05-18T19:51:50.845287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11838","last_updated":"2022-04-15T05:46:23Z","snapshot_observed_at":"2026-08-16T17:25:23.301978Z","submitted_at":"2022-01-27T22:51:58Z","title":"Clinical-Longformer and Clinical-BigBird: Transformers for long clinical sequences","version":3},"cited_work":{"arxiv_id":"2201.11838","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2201.11838","snapshot_observed_at":"2026-07-04T08:39:42.314483Z","title":"Wehbe and Faraz S","venue":null,"work_id":"122d0522-9d62-439f-a334-910236f818bd","year":2022},"citing_paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:49.805446Z"},"links":{"cited_paper":"/paper/2201.11838","citing_paper":"/paper/2604.13561"},"observation_digest":"sha256:5da01593a02aae60dc1d63a3211274af7fbef27a06ce5b59bffe48f3692b4eb5","observation_id":"5ef4fcc6-6eae-4bb7-b927-44b2c4be2020","resolution":{"observed_at":"2026-05-10T14:00:28.806088Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:49.805446Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2604.13561"},"observation_digest":"sha256:5eb1b08e390e7878277037b13716d2b6dc4b920254e661fd9df8d78fbdd8d5f8","observation_id":"872b9791-e43e-40dc-9145-a808c37fa2c1","resolution":{"observed_at":"2026-05-10T14:00:28.800372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.13561","last_updated":"2026-04-15T07:10:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T07:10:01Z","title":"CLIP Architecture for Abdominal CT Image-Text Alignment and Zero-Shot Learning: Investigating Batch Composition and Data Scaling"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":1,"verified_fuzzy":17},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 0 inbound Pith citation observations for arXiv:2604.13561."}