{"as_of":"2026-08-16T01:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bf360aa9e2dc871a6bbe138d9dd5a32811c83ed1a1040e5715a968aada1039a5","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:30:01.202763Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.12108/citation-record","integrity":"/paper/2508.12108/integrity","json":"/paper/2508.12108/citation-record.json","paper":"/paper/2508.12108"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:02.068772Z","title":"Gloria: A multimodal global- local representation learning framework for label-efficient medical image recognition","venue":null,"work_id":"d6964dbd-a975-4445-a88c-178c0d70db11","year":2021},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.875731Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:b68ffd0b6a546563f6be549b680729f8b17b5ca6ab52897298eee03a4a8db460","observation_id":"f4146d61-2732-4516-b624-c2b7aeb8fb25","resolution":{"observed_at":"2026-08-15T17:30:02.073438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:02.054020Z","title":"Medclip: Contrastive learning from unpaired medical images and text","venue":null,"work_id":"a30d071d-76a0-49e8-9a67-5b1da2e0eb90","year":2022},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.881084Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:c13925a3328258c6f5e502285ec35d6d89a664968eaa307e36ee7df6369040eb","observation_id":"8e0f9474-ea4f-4127-9d48-13630f15a833","resolution":{"observed_at":"2026-08-15T17:30:02.059231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01019","last_updated":"2025-04-20T21:18:03Z","snapshot_observed_at":"2026-08-07T17:35:25.237209Z","submitted_at":"2025-03-02T21:09:32Z","title":"MedUnifier: Unifying Vision-and-Language Pre-training on Medical Data with Vision Generation Task using Discrete Visual Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01019","snapshot_observed_at":"2026-08-15T17:30:00.885386Z","title":"Medunifier: Unifying vision-and- language pre-training on medical data with vision generation task using discrete visual representations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.885386Z"},"links":{"cited_paper":"/paper/2503.01019","citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:ca5f9348a62cc6d32c938ab9dbb5df02ff8d3e346d127929b414c6557a712f40","observation_id":"1ca8d35d-1b76-42a3-a122-00b868588b1d","resolution":{"observed_at":"2026-08-15T17:30:00.885386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:02.039160Z","title":"Towards unifying medical vision-and-language pre-training via soft prompts","venue":null,"work_id":"e93794d7-7cb7-4b6d-b7bb-632f7721d169","year":2023},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.890714Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:fc0d5bacb35679b7812e5ff03cad083f7c0aa890eed4b6f54ca64fd0710d389e","observation_id":"aeb99c0f-ea84-4b85-8a41-045a9e128482","resolution":{"observed_at":"2026-08-15T17:30:02.044294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:00.896331Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.896331Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:e63e1fd5338075f83850c5c9e297153389f93d129db5b7b9d6214e530657755b","observation_id":"0da28f04-e7b2-43ac-8fe4-e3b7a886af18","resolution":{"observed_at":"2026-08-15T17:30:00.896331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:00.901789Z","title":"Conditional prompt learning for vision- language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.901789Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:9747d2a65238c369dd390e0dcabb148e4a753237f3c8c28c4691f14f14431de7","observation_id":"31fd3ddf-0019-47de-87cc-ccc666725f89","resolution":{"observed_at":"2026-08-15T17:30:00.901789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:00.907408Z","title":"Learning to prompt for vision-language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.907408Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:79f26b0198a16b695e330ad15c7d7bc702d81b0c4c3e95518ad0518ac8b7be5c","observation_id":"a82cf4d4-0d5e-44a8-a9cc-09e4c9d47e98","resolution":{"observed_at":"2026-08-15T17:30:00.907408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.997424Z","title":"Groupvit: Semantic segmentation emerges from text supervision","venue":null,"work_id":"56476b2c-9557-4eeb-b0a4-311fa0da1f99","year":2022},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.911719Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:78530eb034cac71cf5f15065c78ba456f508c245fd719d875843cfcad4b78399","observation_id":"3d24152b-dd7f-4b0f-b4a2-dc688ba3e347","resolution":{"observed_at":"2026-08-15T17:30:02.002510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.981098Z","title":"Learning to exploit temporal structure for biomedical vision-language processing","venue":null,"work_id":"3bf2c0b9-e611-45c9-99d9-718c972e7c17","year":2023},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.916634Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:9979ddfb00c7467bd7c52596efcb4c4e3b797b70d8667f8b6a395d23f8a8780c","observation_id":"31fd943f-85c2-41fd-80ff-adf890337742","resolution":{"observed_at":"2026-08-15T17:30:01.986018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.965066Z","title":"Cplip: zero-shot learning for histopathology with comprehensive vision-language alignment","venue":null,"work_id":"6a3e56d6-cc04-4191-a934-88f376d3b5ec","year":2024},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.921164Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:5dd5cc2a47aaff5b9be123183fdd3d533a8ecfac761c00f37c92e74204316bfe","observation_id":"1b345788-b913-4dd1-9761-227c17a82168","resolution":{"observed_at":"2026-08-15T17:30:01.969720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.950357Z","title":"Lu, Bowen Chen, Andrew Zhang, Drew F","venue":null,"work_id":"e594c079-b216-40d7-adae-b046947e3d42","year":2023},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.926099Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:a1d62976c207e436e1ab85f6f87ada3d4330239a07de88d10a0da0fe037b7b8a","observation_id":"86beeb90-f59c-497a-bb3a-c9b04b201fe4","resolution":{"observed_at":"2026-08-15T17:30:01.954878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.935213Z","title":"Mimic-cxr, a de-identified publicly available database of chest radiographs with free-text reports","venue":null,"work_id":"9d5f8c44-a918-4dce-bdd2-770d88c645ee","year":2019},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.930789Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:9e35443ec72d55bb17b148fa188a37854cb7f2c1c21eb03ec680020cc0e13437","observation_id":"68253beb-c63f-4592-be58-8e38d3c53ec3","resolution":{"observed_at":"2026-08-15T17:30:01.940037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11207","last_updated":"2025-01-13T18:16:34Z","snapshot_observed_at":"2026-08-13T11:13:47.420356Z","submitted_at":"2023-06-20T00:14:47Z","title":"Quilt-1M: One Million Image-Text Pairs for Histopathology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11207","snapshot_observed_at":"2026-08-15T17:30:00.935549Z","title":"Quilt-1m: One million image-text pairs for histopathology","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.935549Z"},"links":{"cited_paper":"/paper/2306.11207","citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:f27f95c17d8cddfd3fb0642b120f19a2b886b162fb472b5a40e6cc54650f35b9","observation_id":"75d4139c-ac4d-494b-8a81-927e794d3f02","resolution":{"observed_at":"2026-08-15T17:30:00.935549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.921312Z","title":"Towards generalist foundation model for radiology","venue":null,"work_id":"8d89523e-e9cd-4445-b36b-f038158f3865","year":2023},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.942063Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:3482ff95aa53288174893cc2a3f574dc5edeaaba0c20600c585b293139eed155","observation_id":"0e1c04ed-6500-4676-b46e-c47e48b92be3","resolution":{"observed_at":"2026-08-15T17:30:01.925831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00578","last_updated":"2024-03-31T06:55:12Z","snapshot_observed_at":"2026-08-13T19:26:05.889698Z","submitted_at":"2024-03-31T06:55:12Z","title":"M3D: Advancing 3D Medical Image Analysis with Multi-Modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00578","snapshot_observed_at":"2026-08-15T17:30:00.948324Z","title":"M3d: Advancing 3d medical image analysis with multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.948324Z"},"links":{"cited_paper":"/paper/2404.00578","citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:37341cdacf6eddb64e8ea8f6d2b1a2a379242188ad913701a9303a39272ecafe","observation_id":"1c8df07b-4282-4af2-aa22-24f49dff84f6","resolution":{"observed_at":"2026-08-15T17:30:00.948324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:00.954157Z","title":"Align before fuse: Vision and language representation learning with momentum distillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.954157Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:69d4933f314ee26b0b603366dc0e6bada59634f57fabaceff5f95de01139f94d","observation_id":"49a9153b-bea6-4ccc-a6a9-ce080367e416","resolution":{"observed_at":"2026-08-15T17:30:00.954157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:00.959794Z","title":"Bert: Pre-training of deep bidi- rectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.959794Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:5ce7276f71df758b49ba1cbf89439d032f7a9fec0066a7060e21b18292ce8558","observation_id":"005f1bc3-deb3-41eb-92ac-a0cec3d855d0","resolution":{"observed_at":"2026-08-15T17:30:00.959794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:00.964572Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.964572Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:e36923ab6e331472e04f36645a55ae274cf1ad4b634c1092b38c8fc4f3cc4c67","observation_id":"496cac27-372c-429e-8797-9669ab826acc","resolution":{"observed_at":"2026-08-15T17:30:00.964572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:00.969520Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.969520Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:a6bba19c6a352a6eecd79dee0fa64543f8b1ce50d422db8254ac22ee6d54a83e","observation_id":"68afe0c2-a45f-4924-881b-173de1dd5779","resolution":{"observed_at":"2026-08-15T17:30:00.969520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:00.974254Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.974254Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:76d1b879aa530afaec0d369a38a8737759b3ae1fc7cd08bc15cb7600614174a3","observation_id":"37c0d002-2bd2-46df-85b9-868fba55a5fc","resolution":{"observed_at":"2026-08-15T17:30:00.974254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:00.979116Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.979116Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:28d568ea11b0f01b3dd29e655317e2bb3fa7d03ce226442f77c258e5dbaef25e","observation_id":"5fca479a-bce1-4cd0-9d94-f14a8b21dab4","resolution":{"observed_at":"2026-08-15T17:30:00.979116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:00.984629Z","title":"Generative pretraining from pixels","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.984629Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:0b05f770f59153ac1fd848ddbd5f005767f808f8cf55dfb86ef785d88766cd82","observation_id":"4a61a804-ebb8-4aeb-ab57-d0578605cec3","resolution":{"observed_at":"2026-08-15T17:30:00.984629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:00.989479Z","title":"Unsupervised learning of visual representations by solving jigsaw puzzles","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.989479Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:e7130c96340853570ec3607c50fd161af44a471a2a2be21afefdf8feb5b7959e","observation_id":"06722dc4-a9ea-472f-beba-ce93f12056e7","resolution":{"observed_at":"2026-08-15T17:30:00.989479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.836603Z","title":"Colorization as a proxy task for visual understanding","venue":null,"work_id":"22ba4834-1310-45fc-9b20-e90ace02d00c","year":2017},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.994362Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:b4d0bebf20eaceac6e9f233ec9018b5bf9fb8dad9dfceed15d9239dc16cee678","observation_id":"63e30dd3-80c0-4541-b335-0e6e2a759c11","resolution":{"observed_at":"2026-08-15T17:30:01.842145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.821726Z","title":"Self-supervised representation learning by rotation feature decoupling","venue":null,"work_id":"832cc65d-f894-4efa-8d05-017b0ef3e11b","year":2019},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:00.998873Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:529a3bf679c255b069bd2d31304cb7bd19efa91fae110908030ab488f470ce21","observation_id":"1b4a9d23-d3ff-4d1a-ab2a-89b4ac9b4460","resolution":{"observed_at":"2026-08-15T17:30:01.826670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.06606","last_updated":"2021-01-19T15:45:44Z","snapshot_observed_at":"2026-08-01T17:50:49.731424Z","submitted_at":"2020-06-11T16:55:07Z","title":"What makes instance discrimination good for transfer learning?","version":2},"cited_work":{"arxiv_id":"2006.06606","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.06606","snapshot_observed_at":"2026-08-15T17:30:01.361286Z","title":"What makes instance discrimination good for transfer learning?","venue":"cs.CV","work_id":"6957a561-25f3-41fd-869c-a9751a948173","year":2020},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.003745Z"},"links":{"cited_paper":"/paper/2006.06606","citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:7b1659065e2baa216cc919a71bc825ab55426b62f28efb69652a50e2e0eca3b9","observation_id":"0090d0f4-6a32-498e-bf27-7f1752ca3a0b","resolution":{"observed_at":"2026-08-15T17:30:01.367879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.807276Z","title":"Scale-mae: A scale-aware masked autoencoder for multiscale geospatial representation learning","venue":null,"work_id":"82a77727-ac35-44d4-9d33-f28abd2165c7","year":2023},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.009754Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:5caa55a0707e41838fd3b0e120e42239f3fbd2a69890bb4b6566deef743c3c11","observation_id":"d4d30880-b7a7-407a-a716-b7c9dd9545f4","resolution":{"observed_at":"2026-08-15T17:30:01.812120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.014686Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.014686Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:9a3b2fe811a192a67be4648cae8775fa48e74467d58d09dc974c806a1a7fb787","observation_id":"d8a30164-549d-4257-b6ae-c5d0719a8c23","resolution":{"observed_at":"2026-08-15T17:30:01.014686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.019806Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.019806Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:698356ea4826561185f0112169069954c3878bd6ba7acec54ef1397a69e3c29d","observation_id":"bff68324-f635-4ec9-9917-50600d642e81","resolution":{"observed_at":"2026-08-15T17:30:01.019806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T17:30:01.024294Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.024294Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:9da016b1426a6d6b96c4ee0ae5e8354d5a1a6101cf84d90c1915238fc8b0f8f1","observation_id":"742dac01-52cc-4341-9119-f9f86ba32dc5","resolution":{"observed_at":"2026-08-15T17:30:01.024294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.00625","last_updated":"2019-07-17T10:19:12Z","snapshot_observed_at":"2026-08-14T16:53:51.200385Z","submitted_at":"2019-04-01T08:14:29Z","title":"Med3D: Transfer Learning for 3D Medical Image Analysis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.00625","snapshot_observed_at":"2026-08-15T17:30:01.029512Z","title":"Med3d: Transfer learning for 3d medical image analysis","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.029512Z"},"links":{"cited_paper":"/paper/1904.00625","citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:b2753d411d4c2c56278ea24e5f2e33bcf920b6bf801830a1687078fe80603f1b","observation_id":"5967b54d-c824-42c1-b5bc-2245925714b9","resolution":{"observed_at":"2026-08-15T17:30:01.029512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.776181Z","title":"Models genesis","venue":null,"work_id":"c1ccde57-8e03-46a2-98bd-4f497e26a26f","year":2021},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.034025Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:afd1de9b11bfe5f557f01624d2599b46497a6c884bf2bd2f5ff14266c2531846","observation_id":"91e4ed54-2f39-4b4a-9c5e-f58f477b6416","resolution":{"observed_at":"2026-08-15T17:30:01.780656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.038158Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.038158Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:20e3ce0d913206d41da1c9aaf0d2d949880bd22d83b00e50583c16ee12bdeb3d","observation_id":"724bb59d-0b2c-45c6-99ab-a656e72b9bd5","resolution":{"observed_at":"2026-08-15T17:30:01.038158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07490","last_updated":"2019-12-03T19:30:19Z","snapshot_observed_at":"2026-08-14T12:12:43.486524Z","submitted_at":"2019-08-20T17:05:18Z","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07490","snapshot_observed_at":"2026-08-15T17:30:01.043454Z","title":"Lxmert: Learning cross-modality encoder representations from transformers","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.043454Z"},"links":{"cited_paper":"/paper/1908.07490","citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:645d791b84cff86d79b0a176ac00c16e7c35f3fac80438a522c2465417f0e480","observation_id":"bac93bcb-f821-48f2-8ff5-f2c549c8a74f","resolution":{"observed_at":"2026-08-15T17:30:01.043454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.752827Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":"f11f1d1c-29cf-4d4e-aae6-2cec3e2b74d2","year":2020},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.048116Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:341b879603446889de973adc68bfc60b4dd16a58f7e4f07063a416bb30414986","observation_id":"d0d91a95-a7b6-46a2-ac37-2c3d84f12e06","resolution":{"observed_at":"2026-08-15T17:30:01.757157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.738917Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks","venue":null,"work_id":"5395e61d-7e8f-4929-a714-ff1c1e2a0194","year":2020},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.053213Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:3435cb4e5eae0f17d3f8aa631c42eb5a69da75808805131359bd6c2fca0ecba5","observation_id":"f6b30fb9-6e03-4c3a-add7-a7fcd66b4145","resolution":{"observed_at":"2026-08-15T17:30:01.743642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.057338Z","title":"Vinvl: Revisiting visual representations in vision-language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.057338Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:36379062b3adbb703226dc113e3727b45e9ef58aed243b093fefbf0cb69c32a9","observation_id":"a5ce9f45-656d-4090-a193-445a6a8a5b1b","resolution":{"observed_at":"2026-08-15T17:30:01.057338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.062249Z","title":"Coca: Contrastive captioners are image-text foundation models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.062249Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:7cf51f8a2aa1ccd6abf300506cfdf2e377eb9b61463304bda3dd429d5b9ebb75","observation_id":"edff5fdb-e67d-4bf3-a270-1ef58d6df557","resolution":{"observed_at":"2026-08-15T17:30:01.062249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.066457Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.066457Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:1af139cad516405bef6cc2ce60f719f3c0e2b8703a09e619a51931adb479d429","observation_id":"55eeb42c-144f-4743-adf4-d5521a0efe40","resolution":{"observed_at":"2026-08-15T17:30:01.066457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.071454Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.071454Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:beb8fc886795ce682fe33e98b7a42591330e2f053a926a3c57f3a95fc3f37f82","observation_id":"65a2707a-9740-4ef6-b6b8-a553c277d1ab","resolution":{"observed_at":"2026-08-15T17:30:01.071454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.689393Z","title":"Multi-modal understanding and generation for medical images and text via vision-language pre-training","venue":null,"work_id":"089421e7-9ffd-4ea9-ab06-428f148d23b2","year":2022},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.075870Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:eb5b6572e6027cfb6e15cabb18e7c60e54ccd4afb9103807d3150c44165409fa","observation_id":"6df0aa4f-a65e-41d4-a663-6f98aff101bf","resolution":{"observed_at":"2026-08-15T17:30:01.694139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10415","last_updated":"2024-09-08T01:04:35Z","snapshot_observed_at":"2026-08-15T13:17:09.334808Z","submitted_at":"2023-05-17T17:50:16Z","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10415","snapshot_observed_at":"2026-08-15T17:30:01.080927Z","title":"Pmc- vqa: Visual instruction tuning for medical visual question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.080927Z"},"links":{"cited_paper":"/paper/2305.10415","citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:160a0c865efd5dba1fb68872accd37e19361adb956ae022e68462dc10bfad778","observation_id":"ff93f537-8c21-40d3-a176-520255c67df5","resolution":{"observed_at":"2026-08-15T17:30:01.080927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.674245Z","title":"Slip: Self-supervision meets language- image pre-training","venue":null,"work_id":"83874d94-cbcb-4916-9ac6-b33d4916595a","year":2022},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.085437Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:e915e1d2388e57d81a9e11688bcfd75b769f0c13346f2c320789d5d8016666f8","observation_id":"fa7cdee5-57b6-4bea-8382-678291a191c2","resolution":{"observed_at":"2026-08-15T17:30:01.678960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.660123Z","title":"Supervision exists everywhere: A data efficient contrastive language-image pre-training paradigm, 2022","venue":null,"work_id":"aefdfdb2-0932-4e8a-a468-88bd70455d17","year":2022},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.089740Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:d883fdf311bc8a6c806cb6b4f3d087cb9b1f5c5f45f35bb046f22582581a4f4a","observation_id":"30c66838-3b1e-4226-9be9-6e0896c0c7c8","resolution":{"observed_at":"2026-08-15T17:30:01.664933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.094663Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.094663Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:e270d42714f83ecd0c73691e90aa51f3380a21ce234cc680e6dc45230963fcf9","observation_id":"e0504519-2856-4003-a9bc-3a893792e187","resolution":{"observed_at":"2026-08-15T17:30:01.094663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.099089Z","title":"Self-supervised pre-training of swin transformers for 3d medical image analysis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.099089Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:39675b26c67e167751afb84459a1edfee5e88b4d6d349330653490b36e27f3fa","observation_id":"35a0962c-c2a3-47dc-a28a-8495e21b17fd","resolution":{"observed_at":"2026-08-15T17:30:01.099089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.628753Z","title":"Masked image modeling advances 3d medical image analysis, 2022","venue":null,"work_id":"805bdd35-f5ef-4afe-8328-103bceb89d5c","year":2022},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.103864Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:be47dbef513485cce88ddab4baf809d29097f62a479272f1d4de4f0ca377fc02","observation_id":"d36c25de-c9bd-462e-9e61-ddc1f30d4e7f","resolution":{"observed_at":"2026-08-15T17:30:01.633279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.614022Z","title":"V oco: A simple-yet-effective volume contrastive learning framework for 3d medical image analysis","venue":null,"work_id":"22260844-7c8d-41a0-ac13-dcbc2dde077d","year":2024},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.108158Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:ceaf48c14506bfa552a71537185c62537a164a529a557d352e9b3c05ecbd3d8b","observation_id":"a1337afe-146a-4800-bfa3-7a63abe36566","resolution":{"observed_at":"2026-08-15T17:30:01.619401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.07379","last_updated":"2016-11-21T20:56:42Z","snapshot_observed_at":"2026-08-14T22:00:11.687783Z","submitted_at":"2016-04-25T19:42:46Z","title":"Context Encoders: Feature Learning by Inpainting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.07379","snapshot_observed_at":"2026-08-15T17:30:01.113224Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.113224Z"},"links":{"cited_paper":"/paper/1604.07379","citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:7a2201c1efb319cdd72a2899b029c0d48f95b525414caa41dacee3ab42b8f9a8","observation_id":"39c3030c-6260-4ec2-bd81-ceaee3ac0f57","resolution":{"observed_at":"2026-08-15T17:30:01.113224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.07728","last_updated":"2018-03-21T03:21:14Z","snapshot_observed_at":"2026-08-14T19:34:07.960520Z","submitted_at":"2018-03-21T03:21:14Z","title":"Unsupervised Representation Learning by Predicting Image Rotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.07728","snapshot_observed_at":"2026-08-15T17:30:01.118205Z","title":"Unsupervised representation learning by predicting image rotations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.118205Z"},"links":{"cited_paper":"/paper/1803.07728","citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:1ea7fffbfdfbd0f49ab905a89edfbed79cdff2091bd7ab21bd085be5cc870680","observation_id":"d126cba3-332c-4507-9895-8e13a2929756","resolution":{"observed_at":"2026-08-15T17:30:01.118205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-15T17:30:01.122950Z","title":"Representation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.122950Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:a7774594641c5f45f14af063decac7881cce6917a751283c20b8a10076df9b7d","observation_id":"18bc6f70-c1eb-4cf3-8c96-c2732c5712ac","resolution":{"observed_at":"2026-08-15T17:30:01.122950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15524","last_updated":"2021-10-05T22:18:32Z","snapshot_observed_at":"2026-08-15T21:37:28.229240Z","submitted_at":"2020-12-31T10:01:29Z","title":"Fast WordPiece Tokenization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.15524","snapshot_observed_at":"2026-08-15T17:30:01.128489Z","title":"Linear-time wordpiece tokenization","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.128489Z"},"links":{"cited_paper":"/paper/2012.15524","citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:1d2be0c68064f20a37eefc1cd4bc4504eeeb6572dce7640a47d3812182d12f81","observation_id":"0f456fc9-a844-4b98-8b47-c3c06dd978f3","resolution":{"observed_at":"2026-08-15T17:30:01.128489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.600513Z","title":"Zero-shot text-to-image generation","venue":null,"work_id":"81567d7e-29bf-461c-b1c8-eeffbdc7a622","year":2021},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.133289Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:2be98867bde58dac89fb6690ddce2f9e64977144da4198644cfa0f1919fd1649","observation_id":"e9a74340-58c9-4891-88f7-ce9118f5469c","resolution":{"observed_at":"2026-08-15T17:30:01.604840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.138329Z","title":"Swin unetr: Swin transformers for semantic segmentation of brain tumors in mri images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.138329Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:f4064646f65552b6075fae8f311ff15e68e52c3776fc3159fc45a90c56593c23","observation_id":"35db7e1a-a920-464b-accd-d190d1e28d70","resolution":{"observed_at":"2026-08-15T17:30:01.138329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.576786Z","title":"Abdomenct-1k: Is abdominal organ segmentation a solved problem? IEEE Transactions on Pattern Analysis and Machine Intelligence, 44(10):6695–6714, 2022","venue":null,"work_id":"7dbcb61f-b6e0-4bce-8000-ca87f1a0cf93","year":2022},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.142837Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:24d25347302f65a029124396dd29765da04da3174f9c7a00c0bd85e084a7a028","observation_id":"5231ee45-4b53-4ccf-bf1c-777711b32a05","resolution":{"observed_at":"2026-08-15T17:30:01.581111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.562345Z","title":"Ct-org, a new dataset for multiple organ segmentation in computed tomography","venue":null,"work_id":"9ec9ac32-81ed-4398-bab1-1280de4a35d6","year":2020},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.148002Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:d0ce32891b80c7f3a3bc55f043ec67d29bf39ec45d081727cfba39fc835fcc54","observation_id":"ee2307a5-8a02-497e-bdf9-dbeedff77eff","resolution":{"observed_at":"2026-08-15T17:30:01.566777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.548905Z","title":"Ledsam, and Olaf Ronneberger","venue":null,"work_id":"67e3184e-3e17-4af3-a312-0fe894655814","year":2021},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.152348Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:9e1c28c0ad3e195767af8c4fde703da0766df31963cc01f4b28285377aae7af6","observation_id":"517d1b0f-fc32-4797-9814-9daa32543141","resolution":{"observed_at":"2026-08-15T17:30:01.553169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.534697Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"c794b04b-6627-4e21-a269-0db292361cb9","year":2002},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.157227Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:bf8072267893620d66b9f1f2e5417bbe4b1b019a594c0bd8e7ea1b1fd771155a","observation_id":"0419b32a-6f0d-4f36-92ed-505400bf3365","resolution":{"observed_at":"2026-08-15T17:30:01.539265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.519534Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"27d3f3b8-d993-488f-b0a6-7aae0ec5ef49","year":2004},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.161539Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:69a4762777a56694e618bcb458a9ae57c4a6f29e89e0155a34098afc9ef8b412","observation_id":"6787a5d8-402d-4bd3-92a5-6ae847698a9b","resolution":{"observed_at":"2026-08-15T17:30:01.524066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-15T17:30:01.166429Z","title":"Bertscore: Evaluating text generation with bert","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.166429Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:d9df9b0ba7af6ad7f916405c476d24288294748e59846a6912e42c060652a8ed","observation_id":"759c3292-5139-4c5c-b49f-4d11bdce6f35","resolution":{"observed_at":"2026-08-15T17:30:01.166429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.170711Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.170711Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:76592ed54668ecd359a9642e348e64df231425f2821af0d878de2f7783ccb0ef","observation_id":"b728e4d2-5e7e-44e3-bf75-bf7ca624c657","resolution":{"observed_at":"2026-08-15T17:30:01.170711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.495158Z","title":"https://huggingface.co/ContactDoctor/Bio- Medical-Llama-3-8B, 2024","venue":null,"work_id":"c2f984a2-b1ea-412d-9254-8182670e9644","year":2024},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.175442Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:772241031a20e6d24705776bda9e0cc9221d0626f6fb9ab361313fbe67dd987e","observation_id":"77ac4f29-0498-4704-82b8-6e3cb1cf4238","resolution":{"observed_at":"2026-08-15T17:30:01.500789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.179662Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.179662Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:f688521ea8d7d0a9f0261f2135c655bfdafafa4ce8712339ef3ea67655c67bf8","observation_id":"0e4abb36-f73f-4b20-98c6-4184023dd95c","resolution":{"observed_at":"2026-08-15T17:30:01.179662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.184855Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.184855Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:9ec56195f3602e6fe4d5af2de8a85db5033a11184591da54064fe365c873f4dc","observation_id":"ff94ef9a-2544-4cf9-8091-f84bc85c13bd","resolution":{"observed_at":"2026-08-15T17:30:01.184855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.463362Z","title":"Segvol: Universal and interactive volumetric medical image segmentation","venue":null,"work_id":"3f338861-26bf-49bc-96f8-8d45a6d6e5f0","year":2024},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.189214Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:bf4894d8261442991a726ae70cbefcf16bcf47b8f80961ec66b3cc47844532f6","observation_id":"807c9353-43ba-4bfa-8ccb-a1f472aea0fc","resolution":{"observed_at":"2026-08-15T17:30:01.467821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.448806Z","title":"Segment anything in medical images","venue":null,"work_id":"928f539a-cee7-4954-a9e3-e5e3c65b098a","year":2024},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.193525Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:cedfeb155cabd45642f0c80169bfcd1d775218549e6c5c9f3c0439adb7c06f10","observation_id":"70085536-0c4e-4680-b283-50c93e0ab6bd","resolution":{"observed_at":"2026-08-15T17:30:01.453474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.433921Z","title":"Pmc- clip: Contrastive language-image pre-training using biomedical documents","venue":null,"work_id":"545122d2-89a5-4347-88e6-8587b92ffca4","year":2023},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.198485Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:b78c3bd33575f92da3c1c6c4c3c5c7171c14156679451fb2e4248f9828e2649a","observation_id":"d7497ca5-54bc-45f8-9024-6fce54bf1fea","resolution":{"observed_at":"2026-08-15T17:30:01.438351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:30:01.419465Z","title":"Accelerate: Training and inference at scale made simple, efficient and adaptable","venue":null,"work_id":"18c37832-6c55-4800-81c1-cd6521a9344c","year":2022},"citing_paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T17:30:01.202763Z"},"links":{"citing_paper":"/paper/2508.12108"},"observation_digest":"sha256:c8c8b7f8c16221169872cfbd2e5c477c92cc22173d588789aa5f47f074fb3285","observation_id":"f449df5a-836c-4ed5-8d9d-055db0c5d757","resolution":{"observed_at":"2026-08-15T17:30:01.424454Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.12108","last_updated":"2025-08-16T17:08:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T17:22:42.162135Z","submitted_at":"2025-08-16T17:08:43Z","title":"VELVET-Med: Vision and Efficient Language Pre-training for Volumetric Imaging Tasks in Medicine"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2508.12108."}