{"as_of":"2026-08-13T18:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1509cc5df8d4ec83b42af6a849a05db4942b280131682377b4d4aeb89ed72afe","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T13:53:58.181401Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T02:02:47.472868Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T18:25:57.968361Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"cited_work":{"arxiv_id":"2412.12661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.12661","snapshot_observed_at":"2026-07-01T18:25:57.968361Z","title":"Med- max: Mixed-modal instruction tuning for training biomedical assistants.arXiv preprint arXiv:2412.12661","venue":null,"work_id":"bb61315e-b67b-4cc2-bbf5-2896c1116645","year":null},"citing_paper":{"arxiv_id":"2604.15808","last_updated":"2026-04-17T08:06:39Z","snapshot_observed_at":"2026-08-11T19:14:54.764994Z","submitted_at":"2026-04-17T08:06:39Z","title":"Beyond a Single Frame: Multi-Frame Spatially Grounded Reasoning Across Volumetric MRI","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T08:16:33.482990Z"},"links":{"cited_paper":"/paper/2412.12661","citing_paper":"/paper/2604.15808"},"observation_digest":"sha256:c3655512724e1f1cdaddb2e2e8fc33cd1f42e5c6685b19dcecacd67d339a684a","observation_id":"8b73e521-8eb3-4145-b507-629f1c4b1e2c","resolution":{"observed_at":"2026-05-10T08:17:37.029610Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"cited_work":{"arxiv_id":"2412.12661","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.12661","snapshot_observed_at":"2026-07-01T18:25:57.968361Z","title":"Med- max: Mixed-modal instruction tuning for training biomedical assistants.arXiv preprint arXiv:2412.12661","venue":null,"work_id":"bb61315e-b67b-4cc2-bbf5-2896c1116645","year":null},"citing_paper":{"arxiv_id":"2606.27500","last_updated":"2026-06-25T19:36:38Z","snapshot_observed_at":"2026-08-07T13:35:50.634455Z","submitted_at":"2026-06-25T19:36:38Z","title":"Aloe-Vision: Robust Vision-Language Models for Healthcare","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T02:02:47.472868Z"},"links":{"cited_paper":"/paper/2412.12661","citing_paper":"/paper/2606.27500"},"observation_digest":"sha256:2cc0de7d8a95ec6811c54cd599624741fbdc2f566925e3ba367fbabcfca0851d","observation_id":"66265407-5544-4847-86fb-d06de8e4832c","resolution":{"observed_at":"2026-07-01T18:25:57.970152Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.12661/citation-record","integrity":"/paper/2412.12661/integrity","json":"/paper/2412.12661/citation-record.json","paper":"/paper/2412.12661"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:59.339821Z","title":"Multimodal biomedical ai","venue":null,"work_id":"37c318ad-34d0-4b80-aee8-eedf091d0692","year":2022},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.811003Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:4afa0f540ce79971e1515a92cae87919506a23c7b4b6ff8b2f6441d6548a004c","observation_id":"6058d684-f0ea-484d-a743-bea7530e941e","resolution":{"observed_at":"2026-08-11T13:53:59.344984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:59.322890Z","title":"The medical segmentation decathlon","venue":null,"work_id":"8ddc205b-03ef-4043-ae04-119d48674b78","year":2022},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.816646Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:d4e6c4bc5d47cb1390813c27d25a6689691074ab8156ec66458d3520741cf35f","observation_id":"dda12b4e-e200-479f-a8bd-70824dd13808","resolution":{"observed_at":"2026-08-11T13:53:59.328646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-11T13:53:57.821659Z","title":"Openflamingo: An open-source framework for training large autoregressive vision-language models.arXiv preprint arXiv:2308.01390, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.821659Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:a4fb0225e18f28567257b17fb208a7a77fb4d435272b569de03a3b1583247bd2","observation_id":"734bb337-b16a-41df-af5e-931bbce7cb0b","resolution":{"observed_at":"2026-08-11T13:53:57.821659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T13:53:57.826873Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.826873Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:eb8d58934f23e7c9be37239914e2c09dc13f9c08f31d5e2fa591e2930a8c9250","observation_id":"e24032de-c581-49e6-9494-d9aad4e787be","resolution":{"observed_at":"2026-08-11T13:53:57.826873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:57.831765Z","title":"One transformer fits all distributions in multi-modal diffusion at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.831765Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:d1f85698bc7a74494a9d0741c8547d7939b25013af55ab1c71ab4117e52ebc05","observation_id":"04824c7b-d8d3-4a1f-82e7-ce0e3e33855b","resolution":{"observed_at":"2026-08-11T13:53:57.831765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:59.294313Z","title":"The revolution of multimodal large language models: A survey","venue":null,"work_id":"6eea3af3-9dbc-4adb-aeff-0b987c9de17e","year":2024},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.836632Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:0057af389187e9ae96d18faf79c69f69287e9eec75c98a3d6b5b3185616c805d","observation_id":"0b752c21-a271-4f74-8509-5d6cc7dcfbc5","resolution":{"observed_at":"2026-08-11T13:53:59.299563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12737","last_updated":"2022-11-23T06:58:09Z","snapshot_observed_at":"2026-08-13T13:36:55.796161Z","submitted_at":"2022-11-23T06:58:09Z","title":"RoentGen: Vision-Language Foundation Model for Chest X-ray Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12737","snapshot_observed_at":"2026-08-11T13:53:57.841992Z","title":"Roentgen: vision-language foundation model for chest x-ray generation.arXiv preprint arXiv:2211.12737, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.841992Z"},"links":{"cited_paper":"/paper/2211.12737","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:c295eeefa7826d6b5402bb23531335f6b77bdce4ff901df234813ce22013ac85","observation_id":"c7cb75f6-39f6-4346-a4fb-aa7420e799cb","resolution":{"observed_at":"2026-08-11T13:53:57.841992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:59.278087Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale, 2024","venue":null,"work_id":"63284cd2-fe4b-456c-a226-bf304f8c95cf","year":2024},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.847096Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:020c96857cd29b180e21653b743ba7655d71d8b5cb90d19ef02b707a2fb820a2","observation_id":"bc5ff028-7759-4ddd-9df0-5619b4b338ee","resolution":{"observed_at":"2026-08-11T13:53:59.283057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06135","last_updated":"2024-07-08T17:08:02Z","snapshot_observed_at":"2026-08-12T23:26:33.347925Z","submitted_at":"2024-07-08T17:08:02Z","title":"ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06135","snapshot_observed_at":"2026-08-11T13:53:57.851646Z","title":"Anole: An open, autoregressive, native large multimodal models for interleaved image-text generation.arXiv preprint arXiv:2407.06135, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.851646Z"},"links":{"cited_paper":"/paper/2407.06135","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:5ab479578268b83a6c8c03bd56b4cfbbb1e316fa4e65e853d1e590f4fd9103fb","observation_id":"49ed5c40-5b9c-4ee4-bb16-d928b426a4d8","resolution":{"observed_at":"2026-08-11T13:53:57.851646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:57.856815Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.856815Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:c0ae7c2e1a60464b274b49f61633d11999b22a70abc632a9f79acb2f2b5e257e","observation_id":"d2f676f6-45d5-49b0-9298-dafa18a46b6f","resolution":{"observed_at":"2026-08-11T13:53:57.856815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:57.861393Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.861393Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:f1a6ae0897debc9b81d18d65467b9217842e4f9633520d22666e0539f1bf85ed","observation_id":"bd530d22-f985-4fae-b478-a14fa9736dbb","resolution":{"observed_at":"2026-08-11T13:53:57.861393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10765","last_updated":"2023-10-21T02:59:47Z","snapshot_observed_at":"2026-08-13T05:48:07.999941Z","submitted_at":"2023-10-16T18:59:31Z","title":"BiomedJourney: Counterfactual Biomedical Image Generation by Instruction-Learning from Multimodal Patient Journeys","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10765","snapshot_observed_at":"2026-08-11T13:53:57.866401Z","title":"Biomedjourney: Counterfactual biomedical image generation by instruction-learning from multimodal patient journeys.arXiv preprint arXiv:2310.10765, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.866401Z"},"links":{"cited_paper":"/paper/2310.10765","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:30336a4d1b921442662c2bf4dff11f54dc15ec0f03e553b1b01d5781475d3b4f","observation_id":"12da7fe6-3fce-468a-927b-06d9a838e3d8","resolution":{"observed_at":"2026-08-11T13:53:57.866401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.10286","last_updated":"2020-03-07T17:55:41Z","snapshot_observed_at":"2026-07-06T09:06:42.071993Z","submitted_at":"2020-03-07T17:55:41Z","title":"PathVQA: 30000+ Questions for Medical Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.10286","snapshot_observed_at":"2026-08-11T13:53:57.871900Z","title":"Pathvqa: 30000+ questions for medical visual question answering.arXiv preprint arXiv:2003.10286, 2020","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.871900Z"},"links":{"cited_paper":"/paper/2003.10286","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:cd058659bd8b1a200e50753ddd62e9ccc54d6fdf0aaa234d17c8feaf614ebdb9","observation_id":"95faf6f8-04ff-4e7c-a9fe-9ee0b496adfd","resolution":{"observed_at":"2026-08-11T13:53:57.871900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T13:53:57.876860Z","title":"Lora: Low-rank adaptation of large language models.arXiv preprint arXiv:2106.09685, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.876860Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:81bcd13e22e68760c9fe1fcdbe2348a59a35bbac41ad62cacf0710bff486b60e","observation_id":"28eee004-545e-4b93-a78c-f21121fc7365","resolution":{"observed_at":"2026-08-11T13:53:57.876860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:59.242726Z","title":"Omnimedvqa: A new large-scale comprehensive evaluation benchmark for medical lvlm","venue":null,"work_id":"dbff9bbd-7398-4207-ae65-6cf03a0fbebc","year":2024},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.881870Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:4965eea7679cdd60ebbd4ef3d9a1ec8d1f4066c7bc49cf70b07a67a7d64f2ecb","observation_id":"b1aed334-147f-4a7d-85f6-ee70716a7acf","resolution":{"observed_at":"2026-08-11T13:53:59.247554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-11T13:53:57.886422Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.886422Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:d54e96fc9880f8c0a1448a037f4dd03823813cf845a030f8a71079e80343a449","observation_id":"b4b30962-1829-4ed6-af3a-488c8b0e6a8c","resolution":{"observed_at":"2026-08-11T13:53:57.886422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:59.226865Z","title":"Quilt-1m: One million image-text pairs for histopathology","venue":null,"work_id":"ba174a8e-1394-4875-9b56-7366465ae019","year":2024},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.891429Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:2b44b003ccea1b0eb1f685b976d8ee5baf64147fcce5ec4eeb6e89fa4fda02c9","observation_id":"5715a62c-7d54-485c-bbfc-8cb71cb215e8","resolution":{"observed_at":"2026-08-11T13:53:59.232133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.07042","last_updated":"2019-11-14T17:34:51Z","snapshot_observed_at":"2026-08-02T04:11:08.699777Z","submitted_at":"2019-01-21T19:01:00Z","title":"MIMIC-CXR-JPG, a large publicly available database of labeled chest radiographs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.07042","snapshot_observed_at":"2026-08-11T13:53:57.896349Z","title":"Mimic-cxr-jpg, a large publicly available database of labeled chest radiographs.arXiv preprint arXiv:1901.07042, 2019","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.896349Z"},"links":{"cited_paper":"/paper/1901.07042","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:c4a8008c3153dbaa84c70cf7e7afde206ce585e383ad882d8111073ca76f5ab1","observation_id":"6b35c260-7e26-4841-88dd-c577c12e78c1","resolution":{"observed_at":"2026-08-11T13:53:57.896349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:57.901397Z","title":"Peir digital library: Online resources and authoring system","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.901397Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:a478821d03e03aa2d3106327466f96ad9b1e06c854123523b495de600cef8877","observation_id":"b06b9773-f592-4bcc-82d1-e08173e0747d","resolution":{"observed_at":"2026-08-11T13:53:57.901397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:57.906102Z","title":"Chaos challenge-combined (ct-mr) healthy abdominal organ segmentation.Medical Image Analysis, 69:101950, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.906102Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:a3473a22260a30516a1f578edbfd0b20d2410beac00fe9fb83a1fd6b1d4428de","observation_id":"bf6e40fc-8f84-4dfa-a4ec-86ee26184bc7","resolution":{"observed_at":"2026-08-11T13:53:57.906102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-11T13:53:57.910805Z","title":"T\\\" ulu 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.910805Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:7c8c946a0dd7013073966ecdacedada49a94bfa53ea4865858e582eca1e71426","observation_id":"e23dc62d-342f-4cf2-ab56-2811a4a6ff06","resolution":{"observed_at":"2026-08-11T13:53:57.910805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:57.915893Z","title":"A dataset of clinically generated visual questions and answers about radiology images.Scientific data, 5(1):1–10, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.915893Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:9552fdddeccfaba26ef27023483bf21090cf2680aef357dd3a0237f9fac82229","observation_id":"bdb7c5c9-80df-444a-9f38-dccb86343c02","resolution":{"observed_at":"2026-08-11T13:53:57.915893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:59.179605Z","title":"Mimic-it: Multi-modal in-context instruction tuning, 2023","venue":null,"work_id":"27c003eb-81b5-4db2-9d7a-c94919ec77b0","year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.920621Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:0a42ddc5f526b2650538f58ea0ec49a2158e965fc7ca810a4de40b07f0f3e7af","observation_id":"a2a6c59c-bb92-43ca-9b78-f44698fef1d6","resolution":{"observed_at":"2026-08-11T13:53:59.184595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T13:53:57.925146Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.925146Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:3bf04331da878229817842faf00e53348e562129d7d996382c6de8dca14149cb","observation_id":"8ffeab88-3272-451d-b868-6bc06ecfa279","resolution":{"observed_at":"2026-08-11T13:53:57.925146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:59.163406Z","title":"Llava-med: Training a large language-and-vision assistant for biomedicine in one day.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"067d48b8-f624-4a95-966e-e491e29f657c","year":2024},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.929942Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:36f18b983ef896b61cc5cbac83d54d196730c08bd90e73004bf3d217dfc29195","observation_id":"bdfe7f26-1b13-498c-8243-b27199355a8c","resolution":{"observed_at":"2026-08-11T13:53:59.168875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:57.934922Z","title":"Chatdoctor: A medical chat model fine-tuned on a large language model meta-ai (llama) using medical domain knowledge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.934922Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:b77b13a9fcfb311085265c33b40639d6924ca4401630678a4f8f9c718ee1b89d","observation_id":"e4d264b6-7445-4dac-94b1-e195bb86cf23","resolution":{"observed_at":"2026-08-11T13:53:57.934922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:57.939505Z","title":"Pmc- clip: Contrastive language-image pre-training using biomedical documents","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.939505Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:b8a5bb49bb7ace134626670cca7f82c2acc3ac0e308225e6ab011ef68b5ba4de","observation_id":"b4c46895-953a-4f9f-9199-30f9e7f89ef1","resolution":{"observed_at":"2026-08-11T13:53:57.939505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:57.944249Z","title":"Slake: A semantically-labeled knowledge-enhanced dataset for medical visual question answering","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.944249Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:2418a517ed7fb61e7835bec14870d7baec13102c419f910b1ab16ece84b81f12","observation_id":"b0bb1ac7-b82a-4270-8202-35c4dfc91f44","resolution":{"observed_at":"2026-08-11T13:53:57.944249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-13T06:40:28.574929Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-11T13:53:57.949021Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.949021Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:e5bb45df8613d7f91ffe486dff93326e6ecb925f43a07f557537ddee39c87f6e","observation_id":"e6c17c83-840a-4403-a13c-f136ab6213cc","resolution":{"observed_at":"2026-08-11T13:53:57.949021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-11T13:53:57.953983Z","title":"Visual instruction tuning.arXiv preprint arXiv:2304.08485, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.953983Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:fd024342e3c0dd5f1c360c653ffcae80587ddb81ad8b8ac2f77da9477582b88f","observation_id":"e6ce9422-9d3d-40c8-b6b9-1ec44531d420","resolution":{"observed_at":"2026-08-11T13:53:57.953983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17172","last_updated":"2023-12-28T17:57:06Z","snapshot_observed_at":"2026-08-13T04:52:43.165678Z","submitted_at":"2023-12-28T17:57:06Z","title":"Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17172","snapshot_observed_at":"2026-08-11T13:53:57.958991Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision, language, audio, and action.arXiv preprint arXiv:2312.17172, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.958991Z"},"links":{"cited_paper":"/paper/2312.17172","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:69009cba29c3465be8f7d17b1c562a4d0df55d24f775f7ac240d1a66ecacacab","observation_id":"237b7a46-057a-4fcd-8767-6c3bab50669e","resolution":{"observed_at":"2026-08-11T13:53:57.958991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-08-13T11:16:45.283010Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-11T13:53:57.963829Z","title":"Macaw-llm: Multi-modal language modeling with image, audio, video, and text integration","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.963829Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:7144e0a13b8b3e75654b6909a93ea551ef0624cd65c705a8949898b3f0386916","observation_id":"48293247-e7f6-4c2a-bdf6-243e10c9548f","resolution":{"observed_at":"2026-08-11T13:53:57.963829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:59.116025Z","title":"MedPix — medpix.nlm.nih.gov.https://medpix.nlm.nih.gov/home","venue":null,"work_id":"fedae130-7dd1-429c-ad80-208cc4a7d7c1","year":null},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.968892Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:1c43e6b7d81f66b3366b52b77bb486c1da7117f81036d7052416c09e322470b6","observation_id":"8d5a2295-2ebc-4540-bd3b-b393dab8b637","resolution":{"observed_at":"2026-08-11T13:53:59.121536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-11T13:53:57.974935Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.974935Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:9ddfc0dadac7812680e49b20ad96f0117f091441cfea287f5bf986a8552d3335","observation_id":"63a11895-075c-453e-9192-1e8b76f5874c","resolution":{"observed_at":"2026-08-11T13:53:57.974935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:59.099276Z","title":"Med-flamingo: A multimodal medical few-shot learner","venue":null,"work_id":"a57ea438-2be0-45ce-af2e-53194e082ecd","year":null},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.980416Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:39d56bfa59f35fa5a855b70a4153975ce05109755abdbc8515cb9ba581e15282","observation_id":"d7fb46f2-894a-4473-8722-07e80b8f4564","resolution":{"observed_at":"2026-08-11T13:53:59.104499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16452","last_updated":"2023-11-28T03:16:12Z","snapshot_observed_at":"2026-08-13T05:15:47.720293Z","submitted_at":"2023-11-28T03:16:12Z","title":"Can Generalist Foundation Models Outcompete Special-Purpose Tuning? Case Study in Medicine","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16452","snapshot_observed_at":"2026-08-11T13:53:57.985507Z","title":"Can generalist foundation models outcompete special-purpose tuning? case study in medicine.arXiv preprint arXiv:2311.16452, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.985507Z"},"links":{"cited_paper":"/paper/2311.16452","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:3d7ba2e7224a6765d05be5a51fc80b61884036e86acf91bcd6812f966a3baf49","observation_id":"88cb461d-956e-4327-b4a5-a5f8b4644f02","resolution":{"observed_at":"2026-08-11T13:53:57.985507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:57.990367Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.990367Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:76cebaf6de69cd52c432bd4e37bd19015a65fc881d12a499884ad316c30822f4","observation_id":"197436da-9730-462f-8733-6bc2af197728","resolution":{"observed_at":"2026-08-11T13:53:57.990367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:59.070994Z","title":"Gpt-4v(ision) system card, 2023b","venue":null,"work_id":"f6aa0390-7bbf-4898-bde7-bbe2ac72e0d4","year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.994796Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:89e17fab44178ffa6ae33cbd7f959e4d21e6872a414150f691a70c673b8c7452","observation_id":"78110334-7be0-4d74-9b96-15779d4f4180","resolution":{"observed_at":"2026-08-11T13:53:59.075954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:59.055250Z","title":"Gpt-4o-mini","venue":null,"work_id":"c242041e-47b4-47e4-9c7a-4d1cc084ba44","year":2024},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:57.999672Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:911b4810581c3e2de4797a5b2556ad9f953f955eabc02ebc8cd2a5178256d473","observation_id":"ecd247a9-d96a-4be9-9a14-c58ba735e00e","resolution":{"observed_at":"2026-08-11T13:53:59.060152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:59.038040Z","title":"Im2text: Describing images using 1 million captioned photographs","venue":null,"work_id":"737043c0-1651-48c7-bb04-0257ea08cb76","year":2011},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.005250Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:a5cb13c60d7f0736d51e1d07ae3f4876a74c7fcf0614586a7030ccf0f3b4e445","observation_id":"78609a61-5550-4919-ac88-1ded081e3369","resolution":{"observed_at":"2026-08-11T13:53:59.043964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:59.021205Z","title":"A survey on biomedical image captioning","venue":null,"work_id":"0ef46efc-d8fa-43bf-a24c-564f11aa144a","year":2019},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.009947Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:837f8b5ce01a6634b343de647054844f50bc48d63b301e819232c389b5e370cc","observation_id":"a5f3a0b2-ee4f-42d1-8762-60280c19b165","resolution":{"observed_at":"2026-08-11T13:53:59.026613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:59.003900Z","title":"PubMed Central (PMC) — pmc.ncbi.nlm.nih.gov.https://pmc.ncbi.nlm.nih.gov/","venue":null,"work_id":"191fb242-7215-4526-9d84-b4cb225d5c73","year":null},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.015029Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:41f4072a8912a7ad5327d21ae141e4a09731567a3ca017c49d08d2ec68d4b48e","observation_id":"c3dbf298-8342-41c1-a9f0-604e32a3397d","resolution":{"observed_at":"2026-08-11T13:53:59.009357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:58.020129Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in Neural Information Processing Systems, 35:25278–25294, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.020129Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:eb04de52c09538a0d47683d2d87bc3e9b9749920bb02bb1c0ceb60b66d6564f9","observation_id":"c6de0f55-f62e-4cae-b771-3ee55984ec59","resolution":{"observed_at":"2026-08-11T13:53:58.020129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-08-13T18:41:35.355818Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-11T13:53:58.025158Z","title":"Neural machine translation of rare words with subword units","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.025158Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:98f5b25368ea5525b6de51fcc87db5eedeb827d69b0718b9786a57067a1eda1d","observation_id":"6b4376af-af18-4eb7-bc98-1297c6d43b17","resolution":{"observed_at":"2026-08-11T13:53:58.025158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:58.977147Z","title":"Quilt-llava: Visual instruction tuning by extracting localized narratives from open-source histopathology videos","venue":null,"work_id":"7dfb6dfc-bae9-4816-9608-0bfe641cdb6f","year":2024},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.030110Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:09c9d6d4b22f2fa7fe47fa177e01e426075077294d7f96d2c2f02ed55cff0b37","observation_id":"b3ca51b9-df4d-400a-9044-3450ac51e48b","resolution":{"observed_at":"2026-08-11T13:53:58.982137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:58.961522Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"09a56548-a826-4afa-9a1b-b4321be77c9d","year":2018},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.034456Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:2e3b1a08b3a29bae7b1ff8f868610c86ccef4b3b2133d2187fa9fe9856c8882a","observation_id":"a668ff7a-6b70-400f-94a4-a3bb3597ec5a","resolution":{"observed_at":"2026-08-11T13:53:58.966580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:58.945257Z","title":"Pathmmu: A massive multimodal expert-level benchmark for understanding and reasoning in pathology","venue":null,"work_id":"966874c9-c8e5-4ccd-8d39-f14c7ad47548","year":2025},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.039112Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:b020e43ed6afef11213a5522ef1868a9d9ed2e91d1820b1f3709efd270a73450","observation_id":"22c076c6-40cf-460c-b90c-479d6d5590a3","resolution":{"observed_at":"2026-08-11T13:53:58.950400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:58.929188Z","title":"Hashimoto","venue":null,"work_id":"72e6fac2-bb87-4a72-8765-cdc3ee5c7c43","year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.043622Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:4d3931aafa6f44e955e6970bc877b2116bdd7c5b8e22437d44330ed9153ad4da","observation_id":"4c479ebf-513b-43f0-a843-98343df8db0c","resolution":{"observed_at":"2026-08-11T13:53:58.934232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T13:53:58.048405Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.048405Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:ed3d839c858f26e3d3ae82875cd0846069632730fa1c9e71f95a8868fd366d22","observation_id":"07c4df25-de93-48a3-b4ee-f33cebd1455b","resolution":{"observed_at":"2026-08-11T13:53:58.048405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-08-13T14:40:51.995893Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-11T13:53:58.053376Z","title":"Image as a foreign language: Beit pretraining for all vision and vision-language tasks.arXiv preprint arXiv:2208.10442, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.053376Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:4d4c4406e051f604518073a9c88a34eef678b8e4cbe03e29303cbaee6982fca4","observation_id":"f7c8b971-7f9f-4b0a-9a9b-f089b015ed80","resolution":{"observed_at":"2026-08-11T13:53:58.053376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:58.058420Z","title":"Chestx-ray8: Hospital-scale chest x-ray database and benchmarks on weakly-supervised classification and localization of common thorax diseases","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.058420Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:dc261db0a8bc97daab1568c20f98e33c60b0c6e3b6fc1a33efb45a11c7f2108a","observation_id":"775bd66a-2076-4ac7-8156-a684690867da","resolution":{"observed_at":"2026-08-11T13:53:58.058420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-11T13:53:58.063098Z","title":"Emu3: Next-token prediction is all you need.arXiv preprint arXiv:2409.18869, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.063098Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:87446ad73c619c766922980e2d3f92233d0c7a7fc567d03576b66f6e99de97c2","observation_id":"ef3322c1-9a3c-4132-afa5-473ec643ea12","resolution":{"observed_at":"2026-08-11T13:53:58.063098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00024","last_updated":"2024-11-30T00:17:01Z","snapshot_observed_at":"2026-08-12T22:13:18.173326Z","submitted_at":"2024-10-28T22:30:06Z","title":"A Perspective for Adapting Generalist AI to Specialized Medical AI Applications and Their Challenges","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00024","snapshot_observed_at":"2026-08-11T13:53:58.067999Z","title":"A perspective for adapting generalist ai to specialized medical ai applications and their challenges.arXiv preprint arXiv:2411.00024, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.067999Z"},"links":{"cited_paper":"/paper/2411.00024","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:76e35a1d9127d178a65b819d4a2d377fa2100847f7e5a695f70b0bf3ede2282c","observation_id":"c202b4f9-5d50-4413-927a-37be881c1d36","resolution":{"observed_at":"2026-08-11T13:53:58.067999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-13T15:30:05.624512Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-11T13:53:58.074084Z","title":"Finetuned language models are zero-shot learners.arXiv preprint arXiv:2109.01652, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.074084Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:50d018613ab12e331fd5db37b05cdc75e67b9d9b861fdccfa7426e507577049d","observation_id":"1107c9e5-fd9b-4016-a06f-c0355fc96a78","resolution":{"observed_at":"2026-08-11T13:53:58.074084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:58.902744Z","title":"Towards generalist foundation model for radiology, 2023","venue":null,"work_id":"4b3fca02-c448-44c2-a3b2-83190e391b34","year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.078939Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:4359b15827c40e573e93ea7e6ee2cc25838f6c7131ad5f7e791e10864e90a719","observation_id":"681c4060-bf17-48b7-9df0-fc4d588a4138","resolution":{"observed_at":"2026-08-11T13:53:58.907672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:58.886802Z","title":"Medtrinity-25m: A large-scale multimodal dataset with multigranular annotations for medicine, 2024","venue":null,"work_id":"4937dedf-ac64-4a5d-b76a-21d1802a8926","year":2024},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.083391Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:d6ba7a9a6c20bf4e8f9e7ae653c613dd8de641f9f31a96bdc9ffb9b0213a17c9","observation_id":"994c7737-43ac-4690-a6b3-e02ddc2b8846","resolution":{"observed_at":"2026-08-11T13:53:58.891833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:58.869720Z","title":"Medicalgpt: Training medical gpt model.https://github.com/shibing624/MedicalGPT, 2023","venue":null,"work_id":"f65ec8bd-ce14-4c8f-97c8-ef48534ca389","year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.088090Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:427a13e4a43937ce42bac0b4bac9fda8e9c038ad5c45ed1281a4113076014bf0","observation_id":"f4bf1ef5-07d4-440a-994a-b5ad5dfbae0d","resolution":{"observed_at":"2026-08-11T13:53:58.875717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:58.853850Z","title":"Multiinstruct: Improving multi-modal zero-shot learning via instruction tuning","venue":null,"work_id":"be953713-63d4-4f9a-b355-d1f8397f9837","year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.092870Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:ba0e42435a7bf0cdf4543fc3641a670ed9f7c15cf5dd1dd218a9f3f60dcabcce","observation_id":"695006e4-49d0-4762-8b6b-7a500ca6a7d1","resolution":{"observed_at":"2026-08-11T13:53:58.859655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20421","last_updated":"2025-06-10T19:06:46Z","snapshot_observed_at":"2026-08-12T23:53:48.342996Z","submitted_at":"2024-05-30T18:56:01Z","title":"Worse than Random? An Embarrassingly Simple Probing Evaluation of Large Multimodal Models in Medical VQA","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20421","snapshot_observed_at":"2026-08-11T13:53:58.097540Z","title":"Worse than random? an embarrassingly simple probing evaluation of large multimodal models in medical vqa.arXiv preprint arXiv:2405.20421, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.097540Z"},"links":{"cited_paper":"/paper/2405.20421","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:3f1a189991c75eb9eb8fb61148f5ef186be4bd3ea762ec9e35dd4fffc5a51caf","observation_id":"a27c5622-bf51-4e69-b2c8-f7eec232c878","resolution":{"observed_at":"2026-08-11T13:53:58.097540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-11T13:53:58.102285Z","title":"Qwen2 technical report.arXiv preprint arXiv:2407.10671, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.102285Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:7054e6066900479cbaacb45b8d485e8d473d6da1ede1d81dc3b6708444f2907e","observation_id":"1d2303c8-d432-45f9-a61a-e65d6be2d735","resolution":{"observed_at":"2026-08-11T13:53:58.102285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.06687","last_updated":"2023-11-06T07:02:19Z","snapshot_observed_at":"2026-08-13T11:19:29.069742Z","submitted_at":"2023-06-11T14:01:17Z","title":"LAMM: Language-Assisted Multi-Modal Instruction-Tuning Dataset, Framework, and Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.06687","snapshot_observed_at":"2026-08-11T13:53:58.107338Z","title":"Lamm: Language-assisted multi-modal instruction-tuning dataset, framework, and benchmark.arXiv preprint arXiv:2306.06687, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.107338Z"},"links":{"cited_paper":"/paper/2306.06687","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:4d7fff2cffb78a7d8426567b7396201c5f8710995026ce65c4d265c51a4900af","observation_id":"cc79bc80-7495-4fde-9a89-0b4e35b2e3f9","resolution":{"observed_at":"2026-08-11T13:53:58.107338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02591","last_updated":"2023-09-05T21:27:27Z","snapshot_observed_at":"2026-08-13T10:19:44.723226Z","submitted_at":"2023-09-05T21:27:27Z","title":"Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02591","snapshot_observed_at":"2026-08-11T13:53:58.112361Z","title":"Scaling autoregressive multi-modal models: Pretraining and instruction tuning.arXiv preprint arXiv:2309.02591, 2(3), 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.112361Z"},"links":{"cited_paper":"/paper/2309.02591","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:48e209be7046c7c00279a00ddc75bcc94098e7f1b71263e83a6727a288fb79fe","observation_id":"13b7897b-cbf7-4b01-a412-a7c583b5ae98","resolution":{"observed_at":"2026-08-11T13:53:58.112361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-08-13T09:07:54.479155Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-11T13:53:58.117240Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi.arXiv preprint arXiv:2311.16502, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.117240Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:d51393f5ac7791391b8fead7adbb3bb556ddce679165822ee75fc35ceef75c5a","observation_id":"00a7de6b-7378-485f-b38d-338fe0c9ab11","resolution":{"observed_at":"2026-08-11T13:53:58.117240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15075","last_updated":"2023-05-24T11:56:01Z","snapshot_observed_at":"2026-08-13T11:34:32.112528Z","submitted_at":"2023-05-24T11:56:01Z","title":"HuatuoGPT, towards Taming Language Model to Be a Doctor","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15075","snapshot_observed_at":"2026-08-11T13:53:58.122044Z","title":"Huatuogpt, towards taming language model to be a doctor","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.122044Z"},"links":{"cited_paper":"/paper/2305.15075","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:ab463c7053d3b64107b0ecce9ce130b35c8e945b08365b617baa8d833ac33822","observation_id":"2225d483-0dab-4e05-8174-14743ee6c6ec","resolution":{"observed_at":"2026-08-11T13:53:58.122044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00915","last_updated":"2025-01-08T22:58:51Z","snapshot_observed_at":"2026-07-06T14:57:39.647497Z","submitted_at":"2023-03-02T02:20:04Z","title":"BiomedCLIP: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00915","snapshot_observed_at":"2026-08-11T13:53:58.126999Z","title":"Biomedclip: a multimodal biomedical foundation model pretrained from fifteen million scientific image-text pairs.arXiv preprint arXiv:2303.00915, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.126999Z"},"links":{"cited_paper":"/paper/2303.00915","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:94d76b015651eca71e4b23c54606a9146cc07b7f50c1e3a71a11dd5dba0631b9","observation_id":"deec105e-bf65-4d90-983e-e260243826a3","resolution":{"observed_at":"2026-08-11T13:53:58.126999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10415","last_updated":"2024-09-08T01:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:50:16Z","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10415","snapshot_observed_at":"2026-08-11T13:53:58.132247Z","title":"Pmc- vqa: Visual instruction tuning for medical visual question answering.arXiv preprint arXiv:2305.10415, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.132247Z"},"links":{"cited_paper":"/paper/2305.10415","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:aca4d4bfff7c0cd78067448a36b29e49ff73225e318ef8670a3dc355d150b044","observation_id":"3951dd08-1005-4136-9ad6-95b6a4dab81c","resolution":{"observed_at":"2026-08-11T13:53:58.132247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-08-13T11:05:54.841341Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-11T13:53:58.137134Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding.arXiv preprint arXiv:2306.17107, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.137134Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:e7be1e875c2fce4857156bc1d32805dccb97af453c18cf684212a5025e6c5647","observation_id":"2222b20d-9139-44d3-a3c2-0ebc94a796b4","resolution":{"observed_at":"2026-08-11T13:53:58.137134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16280","last_updated":"2024-09-24T17:51:04Z","snapshot_observed_at":"2026-08-12T22:38:25.854863Z","submitted_at":"2024-09-24T17:51:04Z","title":"MonoFormer: One Transformer for Both Diffusion and Autoregression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16280","snapshot_observed_at":"2026-08-11T13:53:58.142077Z","title":"Monoformer: One transformer for both diffusion and autoregression.arXiv preprint arXiv:2409.16280, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.142077Z"},"links":{"cited_paper":"/paper/2409.16280","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:4ae8ccbbacfb166d4cabf61e4fe860636358db50f0180ed7ae6ad7a3cf2edfdd","observation_id":"2d157ae1-cfae-4674-8a90-233e2254ebaf","resolution":{"observed_at":"2026-08-11T13:53:58.142077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-08-11T01:34:46.484513Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-08-11T13:53:58.146912Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model.arXiv preprint arXiv:2408.11039, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.146912Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:6079880300e2407f66e7a4a8fd6178e59ca2b749dcb51f0d5f7f00706bf4e3f3","observation_id":"82e2c50d-4223-4307-9e18-741075495f1f","resolution":{"observed_at":"2026-08-11T13:53:58.146912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T13:53:58.151781Z","title":"Magnetic Resonance,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.151781Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:d832f37081954e39553129a290424bf68c8c02515c1dbdb708dbb93d322d1768","observation_id":"f934a191-e118-4527-92a5-fb6c6c17a7d0","resolution":{"observed_at":"2026-08-11T13:53:58.151781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:58.837473Z","title":null,"venue":null,"work_id":"7facc785-b2d0-4dae-b0e5-13b9d0a5d2d8","year":null},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.156619Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:36db3bf59be4c4c92a1802bde65c84d4242fc8a71176f774153120593adf5f89","observation_id":"475a6fdc-cdbf-4033-ad04-4db1f5739b26","resolution":{"observed_at":"2026-08-11T13:53:58.842807Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:58.820830Z","title":null,"venue":null,"work_id":"6d62643d-9f19-41e3-9505-c5004ca5eaad","year":null},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.161868Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:d22466bfdd6f4ffb4641cc8f35bf3a5b1bfa4019bb70fe4f09415e0d02f745d6","observation_id":"d2433d6e-a787-4e4e-b78e-009be68dbf46","resolution":{"observed_at":"2026-08-11T13:53:58.825626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:58.805675Z","title":null,"venue":null,"work_id":"bd575faa-4acc-41b9-be5c-7220e33c975f","year":null},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.167494Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:cdb8f99db2cc9f3185c5bcdd2bd936ef80a90bfff8b406eaee4472716f0c21f7","observation_id":"36e5f0eb-afe3-4432-b56c-24cb28f5754d","resolution":{"observed_at":"2026-08-11T13:53:58.810290Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:58.790358Z","title":null,"venue":null,"work_id":"89efd2f2-c811-4a1d-8017-5633dd1b00fe","year":null},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.172262Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:23ee672b001f8e529b127807350dc7c35e882540785692b58e3b94d64d9ae1df","observation_id":"367cb785-a457-4473-8808-e00c67195bdd","resolution":{"observed_at":"2026-08-11T13:53:58.795074Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:58.775269Z","title":null,"venue":null,"work_id":"53fa12de-75ed-4acb-a10f-cd6354d5d575","year":null},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.176870Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:d9938c4f8b9576a3449a2c0c62d741fafd7e7f19564035b5a0d782a8fa065e3a","observation_id":"ea08829a-8123-462f-baeb-83f7cd7a248d","resolution":{"observed_at":"2026-08-11T13:53:58.779851Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T13:53:58.759221Z","title":"The answer is: Yes","venue":null,"work_id":"75bc9727-d813-41ba-bea1-9e8a1ab21d71","year":null},"citing_paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T13:53:58.181401Z"},"links":{"citing_paper":"/paper/2412.12661"},"observation_digest":"sha256:3e298f030fe216b84700b28fca697a46842e2ba12978d3521510df8c8b2308c2","observation_id":"45a91932-ff9d-4afa-844c-e37784607b93","resolution":{"observed_at":"2026-08-11T13:53:58.764849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.12661","last_updated":"2025-04-23T06:29:51Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T03:19:50.620382Z","submitted_at":"2024-12-17T08:30:00Z","title":"MedMax: Mixed-Modal Instruction Tuning for Training Biomedical Assistants"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":24},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 2 inbound Pith citation observations for arXiv:2412.12661."}