{"as_of":"2026-08-18T11:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d1a808cc3c49b6c1d65f5e235feb858af361b165e86eebb5cf39d2b57475880d","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:08:56.179861Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T20:21:40.867354Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T20:23:23.797407Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"cited_work":{"arxiv_id":"2506.13102","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.13102","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","venue":null,"work_id":"f14f8aa6-0f68-42a2-a019-deb7daf50175","year":2025},"citing_paper":{"arxiv_id":"2512.19691","last_updated":"2026-04-13T08:00:46Z","snapshot_observed_at":"2026-08-15T02:19:53.563972Z","submitted_at":"2025-12-22T18:59:34Z","title":"Scalable Stewardship of an LLM-Assisted Clinical Benchmark with Physician Oversight","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T20:21:40.867354Z"},"links":{"cited_paper":"/paper/2506.13102","citing_paper":"/paper/2512.19691"},"observation_digest":"sha256:2453c5c496ffd4759307c292130a4cc6bb76cee6269e557b644a5be56bb8253f","observation_id":"680b9b8d-f675-48e3-b296-a157c95fb431","resolution":{"observed_at":"2026-05-16T20:23:23.799795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.13102/citation-record","integrity":"/paper/2506.13102/integrity","json":"/paper/2506.13102/citation-record.json","paper":"/paper/2506.13102"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:55.124456Z","title":"Language mod- els are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.124456Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:999f635cb205d8410b060f595cfaa4b8bfd1edb32ead4481ddae0aa3136dc325","observation_id":"7b0a2c50-eedf-411b-8430-ed1bac389c9e","resolution":{"observed_at":"2026-08-15T20:08:55.124456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:08:55.141698Z","title":"GPT-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.141698Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:94b34b6e9aab2f9940dc3809ce0efeb57a8672486117b5a2e26877b56e6dd687","observation_id":"4753e2e6-d135-4a78-b5b1-c63cd0609a0a","resolution":{"observed_at":"2026-08-15T20:08:55.141698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:55.147428Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.147428Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:770fc817134e91bed20b6b0a701d29779ae05803c5297a18c34a631a44ef9c32","observation_id":"4c616e0e-d59c-4497-9610-82db37a225d7","resolution":{"observed_at":"2026-08-15T20:08:55.147428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T20:08:55.151764Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.151764Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:2423afc5fa806ac61e2ed1836098df6850ac756d37566441673a39efaac00ba1","observation_id":"6e4b2c4d-7cf0-4a35-9bb2-7a1761e7923a","resolution":{"observed_at":"2026-08-15T20:08:55.151764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-15T20:08:55.223274Z","title":"GPT-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.223274Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:28f703d272af44dc926097139d901a14f0a80dfd013af4a14b526d1f1ea2be78","observation_id":"06756117-ce0f-416b-9dfd-21e71c5bbe85","resolution":{"observed_at":"2026-08-15T20:08:55.223274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-15T20:08:55.227739Z","title":"OpenAI o1 system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.227739Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:a2759b08f82a6d5a577f3ccec9b178022ab736123bded39cf412fe0cb6bd9db7","observation_id":"a593b253-553e-4392-b8e4-642814dda7ea","resolution":{"observed_at":"2026-08-15T20:08:55.227739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:57.797212Z","title":"The Llama 3 herd of models,","venue":null,"work_id":"f3359f40-eab2-445a-990e-931d39d5a11e","year":2024},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.233969Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:b9a693a55ba8f1872ddc7dc887759188482f334dec9940759f8d7921486beb81","observation_id":"bbe4fede-64ea-4740-88f7-a8cf9a20e6e5","resolution":{"observed_at":"2026-08-15T20:08:57.800688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T20:08:55.238359Z","title":"DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.238359Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:d287fe7679b079c62f111129290f95b7706c302d96681946c81197da8fa428e7","observation_id":"c61b68e7-ddc5-4bdb-aaaf-13692b1cc8cc","resolution":{"observed_at":"2026-08-15T20:08:55.238359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T20:08:55.242792Z","title":"Qwen2.5 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.242792Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:0a351a500dccf8f345e881f502297adb23131fd2ecc6269aaa968dd51b8fa5e9","observation_id":"064a8092-116e-445a-bfdf-6a7965ba7994","resolution":{"observed_at":"2026-08-15T20:08:55.242792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:57.784874Z","title":"Flamingo: A visual language model for few-shot learning,","venue":null,"work_id":"15adb4f4-b7f1-46fd-96d5-b67aa12fc434","year":2022},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.366044Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:a1868333bc56d11f7c98a5e85496f8e6b1c7c94953b4605425496b93ef8d926d","observation_id":"a3e259a8-4b9a-4b80-b93a-ca1e3fc33bf6","resolution":{"observed_at":"2026-08-15T20:08:57.789598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:57.615637Z","title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":"04fbeca5-5674-4584-9bfe-d426cfbbe487","year":2022},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.405005Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:b0dd3931be2f705ac252eca8afdf484f34be7c8a0bbe7895ebe74fe23ded1c69","observation_id":"05a1f538-d81f-474c-b8a2-56c9f50484e9","resolution":{"observed_at":"2026-08-15T20:08:57.710527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:55.410289Z","title":"BLIP-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.410289Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:57423ad819cc978151164b5bed4f1b10914b8fb7bd4e18d3d32db0c7b41a88eb","observation_id":"530c4658-ba4c-41af-bc8e-fce5cd327e10","resolution":{"observed_at":"2026-08-15T20:08:55.410289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:57.558330Z","title":"Visual instruction tuning,","venue":null,"work_id":"4c6ba053-6f50-40d1-8cc1-03b32c7b1a10","year":2023},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.414433Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:8636c6a7b4b93a1483616542e536b1a1955413830663d6bfbb18acb2ec8615a6","observation_id":"b95d9010-9af5-43c6-b9e6-b1faae1f807c","resolution":{"observed_at":"2026-08-15T20:08:57.562887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-15T20:08:55.418177Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.418177Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:74445d169ba562e32f1978244ba3c36b482030b0f3e09bb85f61f5f0e8f29902","observation_id":"e385f19d-5186-4fbc-9e23-8ac8856a921b","resolution":{"observed_at":"2026-08-15T20:08:55.418177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-15T20:08:55.462198Z","title":"Qwen2-VL: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.462198Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:5ba29c463c12a11f637ff5835e7a6695dd0ef391e3753f9c8f547393b40437d9","observation_id":"22826580-31b0-4246-a375-d883e59e8234","resolution":{"observed_at":"2026-08-15T20:08:55.462198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:55.535151Z","title":"xGen-MM (BLIP- 3): A family of open large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.535151Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:b4aa53b034f3e81a74c59840b554426ec19212ed5420533f6fee76ce8a95e5ea","observation_id":"bff8de91-a652-4f31-ac7c-905595c66010","resolution":{"observed_at":"2026-08-15T20:08:55.535151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-08-17T11:00:39.333660Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-15T20:08:55.538463Z","title":"s1: Simple test-time scaling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.538463Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:679953d1f72fbca46245214e926dc35deabf6d3dec1c6b940165bb9d323fdcad","observation_id":"da645a20-c07b-4bfc-8d86-5117e16b7cd0","resolution":{"observed_at":"2026-08-15T20:08:55.538463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:57.545807Z","title":"Scaling LLM test-time compute optimally can be more effective than scaling parameters for reasoning,","venue":null,"work_id":"a8eb8c5f-b6ba-440b-9326-0f60b4fad3d8","year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.542632Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:c053bed36d7e919e9a55d7ba4611653c519c13ba4af9788b9557cffffdd196fd","observation_id":"ec0a4d29-8a6e-4bb1-9bea-0771b8316d95","resolution":{"observed_at":"2026-08-15T20:08:57.550107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:55.546352Z","title":"Towards thinking-optimal scaling of test-time compute for LLM reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.546352Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:4e4cf595eb684953f8065310f1541df1643a3524bf72788d51670fecc5232540","observation_id":"4e9df956-644d-4631-9f00-cffa58cbc8c8","resolution":{"observed_at":"2026-08-15T20:08:55.546352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12215","last_updated":"2025-03-03T15:29:43Z","snapshot_observed_at":"2026-08-16T12:57:50.741381Z","submitted_at":"2025-02-17T07:21:11Z","title":"Revisiting the Test-Time Scaling of o1-like Models: Do they Truly Possess Test-Time Scaling Capabilities?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12215","snapshot_observed_at":"2026-08-15T20:08:55.549727Z","title":"Revisiting the test- time scaling of o1-like models: Do they truly possess test-time scaling capabilities?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.549727Z"},"links":{"cited_paper":"/paper/2502.12215","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:f29e3a326532e89b6e02734e9b51e2cbeea58ca48b75737654db21adb26c98c3","observation_id":"4bab2202-125b-4014-97e0-44bc5e33e238","resolution":{"observed_at":"2026-08-15T20:08:55.549727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T20:08:55.562878Z","title":"Prox- imal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.562878Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:bf760891c3bb386e57de7ec01579d93c0924f58dbdf223ac0e67fa39af98a579","observation_id":"e44cf1a0-81c2-4168-aefa-483f175b4bb3","resolution":{"observed_at":"2026-08-15T20:08:55.562878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:55.635279Z","title":"Direct preference optimization: Your language model is secretly a reward model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.635279Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:524d5f2ff6b00918d7572cf2e43b4d5bacb2a8e4e142b1c3ee52509e38d0d288","observation_id":"0da8faa2-e808-44a4-beda-1698e698f800","resolution":{"observed_at":"2026-08-15T20:08:55.635279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-15T20:08:55.690086Z","title":"DeepSeekMath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.690086Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:458d5d6a33d5f454c699d3be557c3c25db3c3304184c3572f852411b83bfbdfe","observation_id":"76204dec-a21e-4f2b-b428-85aa95f56659","resolution":{"observed_at":"2026-08-15T20:08:55.690086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:57.456955Z","title":"Multi- modal understanding and generation for medical images and text via vision-language pre-training,","venue":null,"work_id":"6cfc13df-da28-4a19-a88a-52e1cf5a7339","year":2022},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.694124Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:63f3a2d79811590fa8e828841c5e07c16e96d4adf4a4b0a74d7c31a1b88e532d","observation_id":"22b1ecc4-a5eb-474e-a1a8-c6eae3be5a34","resolution":{"observed_at":"2026-08-15T20:08:57.461742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:57.444516Z","title":null,"venue":null,"work_id":"2f16ff74-19d0-4bb5-be51-9a71cdad3c33","year":2023},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.697643Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:68b642052c787a75832fbdd4948fe510126beb949643e8e6fc4e492c2dde2476","observation_id":"28243b47-b668-4044-bca5-9156feb687cb","resolution":{"observed_at":"2026-08-15T20:08:57.448793Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:57.390680Z","title":"Self- supervised multi-modal training from uncurated images and reports enables monitoring AI in radiology,","venue":null,"work_id":"8fc0eb53-3c0c-48be-b5e3-8af0473be050","year":2024},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.701654Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:730f06ebe4612de6c783f3a7f9bf2ac49c1f39215647a2aa5e4d6c17e40321f8","observation_id":"bf6b27bb-818f-48c2-8440-a268e68fd01a","resolution":{"observed_at":"2026-08-15T20:08:57.394904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18925","last_updated":"2024-12-25T15:12:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-25T15:12:34Z","title":"HuatuoGPT-o1, Towards Medical Complex Reasoning with LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18925","snapshot_observed_at":"2026-08-15T20:08:55.704689Z","title":"HuatuoGPT-o1, towards medical complex reasoning with LLMs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.704689Z"},"links":{"cited_paper":"/paper/2412.18925","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:261c9ed6845ded0cb0a65bb84d25c564e758d992a12efc0eeefb7c8b504add7f","observation_id":"738fdb9f-5c11-4efc-add8-aa5359ecb97a","resolution":{"observed_at":"2026-08-15T20:08:55.704689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:57.376860Z","title":"A generalist vision–language foundation model for diverse biomedical tasks,","venue":null,"work_id":"5a83412d-ccf6-454a-ad99-611169296b8d","year":2024},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.780569Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:7a91ee01e53cbb8eb02fc80ee739b53bcdbb6f1bcaa5c3c8ccc5c7373690c343","observation_id":"84343929-6fe0-4463-9fd7-3f7453690286","resolution":{"observed_at":"2026-08-15T20:08:57.381097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:57.366392Z","title":"UltraMedical: Building specialized generalists in biomedicine,","venue":null,"work_id":"8ea81910-2503-46d6-b2a4-10b520765312","year":2024},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.804489Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:3f0dcf956148743f901b07b4c54c20822ff80a3ff6f17b7bd700e17b5dfaab77","observation_id":"f78290e5-db76-4106-868b-4ddcc2383e62","resolution":{"observed_at":"2026-08-15T20:08:57.370481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:55.808418Z","title":"Meds3: Towards medical small language models with self-evolved slow think- ing,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.808418Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:8e7d5d4773fdd2efec31cbc19c23d8984a120778751d5c6f4198c6bccfed5659","observation_id":"9b0666fb-8b0f-4968-b582-caaafe41df4c","resolution":{"observed_at":"2026-08-15T20:08:55.808418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:55.811651Z","title":"QoQ-Med: Building mul- timodal clinical foundation models with domain-aware GRPO training,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.811651Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:a4719714c085c7703c6ac90995804f4980d82831865a51531e54836881f6df6c","observation_id":"f7e4be9b-e182-44f4-ae70-0f754d3eb3d5","resolution":{"observed_at":"2026-08-15T20:08:55.811651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:55.815623Z","title":"Med-R1: Reinforcement learning for generalizable medical reasoning in vision-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.815623Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:feb7fea5595a6ad8941ae8133b4852a1ffc6c02570ae5ec6155d651647ee33db","observation_id":"8f69da79-126c-4cd3-8f98-1e119ee4a05e","resolution":{"observed_at":"2026-08-15T20:08:55.815623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19634","last_updated":"2025-03-19T13:55:33Z","snapshot_observed_at":"2026-08-16T12:54:49.819371Z","submitted_at":"2025-02-26T23:57:34Z","title":"MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19634","snapshot_observed_at":"2026-08-15T20:08:55.819290Z","title":"MedVLM-R1: Incentivizing medical reasoning capability of vision-language models (VLMs) via reinforcement learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.819290Z"},"links":{"cited_paper":"/paper/2502.19634","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:29c4c7b64785c89abb0161da37cee1f9de40419e9a0f90c71190253c826bed35","observation_id":"77892960-1b0e-4769-822a-20f873b956b8","resolution":{"observed_at":"2026-08-15T20:08:55.819290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:55.822853Z","title":"m1: Unleash the potential of test-time scaling for medical reasoning with large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.822853Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:c9c6837c6f3919fd9bb50272cf880671881d989728c17d934ce0daf3113ff6f6","observation_id":"a9b60ebc-cb9b-46ca-ad37-6b703ba5b9ba","resolution":{"observed_at":"2026-08-15T20:08:55.822853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06458","last_updated":"2025-01-11T07:10:23Z","snapshot_observed_at":"2026-08-16T12:59:12.679844Z","submitted_at":"2025-01-11T07:10:23Z","title":"O1 Replication Journey -- Part 3: Inference-time Scaling for Medical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06458","snapshot_observed_at":"2026-08-15T20:08:55.826144Z","title":"O1 replication journey–Part 3: Inference-time scaling for medical reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.826144Z"},"links":{"cited_paper":"/paper/2501.06458","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:a4becd01f25d97244620dc51af652c3463a119e1ac97df20b27286cfbf119368","observation_id":"46bd650c-b874-468a-ad66-edb98301abcd","resolution":{"observed_at":"2026-08-15T20:08:55.826144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00294","last_updated":"2025-03-31T23:40:28Z","snapshot_observed_at":"2026-08-16T12:45:08.763942Z","submitted_at":"2025-03-31T23:40:28Z","title":"Inference-Time Scaling for Complex Tasks: Where We Stand and What Lies Ahead","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00294","snapshot_observed_at":"2026-08-15T20:08:55.845303Z","title":"Inference-time scaling for complex tasks: Where we stand and what lies ahead,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.845303Z"},"links":{"cited_paper":"/paper/2504.00294","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:5c801d4de66017231bdfbc0cba067a8abdba4885aa78c1d291ab6f7dc4d8043a","observation_id":"3efa8456-6b54-4f43-a834-6df34c35e6b3","resolution":{"observed_at":"2026-08-15T20:08:55.845303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-16T13:39:01.243847Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-15T20:08:55.923492Z","title":"HuatuoGPT-Vision, towards injecting medical visual knowledge into multimodal LLMs at scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.923492Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:3b2d24984a66b39589c7a27ac370ded7fd982ec811f50c5143a7198fb0337558","observation_id":"592a6bd3-963f-47f0-a361-7739fe31f85f","resolution":{"observed_at":"2026-08-15T20:08:55.923492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:57.267997Z","title":"MedGemma: Advanced AI models for medical text and image analysis,","venue":null,"work_id":"ce7a6816-ee1e-4b58-b98b-2bc69071609f","year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.950864Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:b8fe75f780658f814c58c89262347d725da429970fa4ec7023b37acc7947a53f","observation_id":"9c0eec9f-606e-4fd9-b6f3-66c7b76437cb","resolution":{"observed_at":"2026-08-15T20:08:57.331628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-15T20:08:55.954295Z","title":"Qwen2.5-VL technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.954295Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:ddf826eeee34f1b50442a4aa15b2b3bfb8b88340d9c96b7afba16cf2acbae66b","observation_id":"8e59b2a0-97c4-4c50-970e-b14c02ad2226","resolution":{"observed_at":"2026-08-15T20:08:55.954295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-15T20:08:55.958124Z","title":"Gemma 3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.958124Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:29c7aed19bad8f3d2fd36eed33026e45c32948d3c94a59eff028c3b025b905d0","observation_id":"e2a23158-576a-44c3-a1d5-294050a1fbef","resolution":{"observed_at":"2026-08-15T20:08:55.958124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-15T17:00:20.282987Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-15T20:08:55.962530Z","title":"LLaV A- o1: Let vision language models reason step-by-step,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.962530Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:2488275447b67cbd76243b8ca28e46d6cb341796b040331760628726998475f7","observation_id":"1a7385db-4402-4c20-bf65-267dc2d697df","resolution":{"observed_at":"2026-08-15T20:08:55.962530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:57.256775Z","title":"QVQ: To see the world with wisdom,","venue":null,"work_id":"fc6a5a56-ec85-4756-b411-3554749ce050","year":2024},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:55.988044Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:98085366651595bff411f4ecf5135ae8d09351d7195768c1fba8ee7a5a481b1b","observation_id":"754dd459-be40-47fe-961d-457c58b60ac2","resolution":{"observed_at":"2026-08-15T20:08:57.260355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-08-17T20:16:19.173618Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-15T20:08:56.037648Z","title":"Yi: Open foundation models by 01. ai,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:56.037648Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:744e814d3b601baa5c6694b7cd4cc385397e2dc10fbe0865d695fad6a82a3eda","observation_id":"4f5cf823-c308-44ef-a620-093d8701be0c","resolution":{"observed_at":"2026-08-15T20:08:56.037648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07667","last_updated":"2025-03-20T05:05:56Z","snapshot_observed_at":"2026-08-18T08:25:53.402767Z","submitted_at":"2025-03-09T01:45:05Z","title":"CLIMB: Data Foundations for Large Scale Multimodal Clinical Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07667","snapshot_observed_at":"2026-08-15T20:08:56.042381Z","title":"CLIMB: Data foundations for large scale multimodal clinical foundation models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:56.042381Z"},"links":{"cited_paper":"/paper/2503.07667","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:027a9c30f9c2a955b5ef92239036913d8a24b8a34a641d4186f4a7052960698a","observation_id":"6bccdcd1-5787-45f5-802f-6df2a64f15f2","resolution":{"observed_at":"2026-08-15T20:08:56.042381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.06146","last_updated":"2019-09-13T11:18:20Z","snapshot_observed_at":"2026-08-17T06:10:48.003173Z","submitted_at":"2019-09-13T11:18:20Z","title":"PubMedQA: A Dataset for Biomedical Research Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.06146","snapshot_observed_at":"2026-08-15T20:08:56.046556Z","title":"PubMedQA: A dataset for biomedical research question answering,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:56.046556Z"},"links":{"cited_paper":"/paper/1909.06146","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:175452268ea6186b90f36d5d7525e53fd61afcea3c9ad93f6b0d3ae9a65cf251","observation_id":"3d02aa01-2c35-4776-abf1-9888f4d5e465","resolution":{"observed_at":"2026-08-15T20:08:56.046556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:57.174495Z","title":"What disease does this patient have? A large-scale open domain question answering dataset from medical exams,","venue":null,"work_id":"3aff010e-e548-4321-ad10-4e771a2e13fb","year":2021},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:56.050738Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:849f09a11045487274c7be8fdda0429ddc4401afd956c611e43368591f02c818","observation_id":"7075c5e6-5d92-4af9-8c3a-c80fbf4839fd","resolution":{"observed_at":"2026-08-15T20:08:57.247426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:57.164440Z","title":"Benchmarking large language models on answering and explaining challenging medical questions,","venue":null,"work_id":"49c78b5c-2230-4fdc-a561-b5b9f7f1d565","year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:56.055975Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:d4a67d0db27c8a0ff5e9944e7480b5a691ceb1d0d0533e100815b576101fb83c","observation_id":"6a6c7447-317c-477e-a5ff-253fc2ffa83c","resolution":{"observed_at":"2026-08-15T20:08:57.167902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18362","last_updated":"2025-06-06T13:00:07Z","snapshot_observed_at":"2026-08-17T19:58:59.903876Z","submitted_at":"2025-01-30T14:07:56Z","title":"MedXpertQA: Benchmarking Expert-Level Medical Reasoning and Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18362","snapshot_observed_at":"2026-08-15T20:08:56.122012Z","title":"MedXpertQA: Benchmarking expert-level medical reasoning and understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:56.122012Z"},"links":{"cited_paper":"/paper/2501.18362","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:dae629dc1f8626af59ab0b049b79bc432f3d19a79813f704398977f5e5119999","observation_id":"79acf541-ad73-46d9-9e9d-714dce4bdc6e","resolution":{"observed_at":"2026-08-15T20:08:56.122012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:57.152362Z","title":"MedCalc- Bench: Evaluating large language models for medical calculations,","venue":null,"work_id":"9a279c30-3d2d-4016-a3b3-23ddb3547c82","year":2024},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:56.152954Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:c388a566f02c439dc12d1f9d22a973b73a9e4d8bfb9ec9590ce3a2ba91f044cc","observation_id":"3080d3ec-677f-48eb-839e-1768a50be057","resolution":{"observed_at":"2026-08-15T20:08:57.157554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22746","last_updated":"2025-03-26T23:28:21Z","snapshot_observed_at":"2026-08-18T00:56:24.333512Z","submitted_at":"2025-03-26T23:28:21Z","title":"Susceptibility of Large Language Models to User-Driven Factors in Medical Queries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22746","snapshot_observed_at":"2026-08-15T20:08:56.158706Z","title":"Susceptibility of large language models to user-driven factors in medical queries,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:56.158706Z"},"links":{"cited_paper":"/paper/2503.22746","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:16041d1afe2de4eaaa5041c304dc2f37006e503747eac27a8643401c558c1f64","observation_id":"d43c90ba-8170-4cd3-917a-5021630d60b7","resolution":{"observed_at":"2026-08-15T20:08:56.158706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:57.009518Z","title":"Om- niMedVQA: A new large-scale comprehensive evaluation benchmark for medical LVLM,","venue":null,"work_id":"104db12a-e2ea-4d47-980b-982f4a044a2e","year":2024},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:56.163445Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:c150a6999f468411ff2c1e86edff92185fb9a2e11ae62ac1dc37bc2585b0a5b5","observation_id":"b3b38278-e171-4a35-a6a1-0a04189889f8","resolution":{"observed_at":"2026-08-15T20:08:57.114343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:08:56.168439Z","title":"Training language models to follow instructions with human feedback,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:56.168439Z"},"links":{"citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:2e5d84c3f9e262ed1ac32057aa2f39dcc1c1c52258ccf73fa7d2aacac986bc46","observation_id":"e44fe3ff-952c-4e40-b0af-a8b0bbf8a533","resolution":{"observed_at":"2026-08-15T20:08:56.168439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-17T15:29:47.883677Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-15T20:08:56.172268Z","title":"KTO: Model alignment as prospect theoretic optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:56.172268Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:8908c0826b0c5f9f028623578f68eccad5ddef1bc9c130acbf0aca7466b1e8b2","observation_id":"6fb26c6c-8d62-420a-8b19-f03bc8da0079","resolution":{"observed_at":"2026-08-15T20:08:56.172268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-08-15T05:29:13.739206Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-15T20:08:56.176954Z","title":"Reasoning models don’t always say what they think,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:56.176954Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:74b23219f6b781c99e11b63abd7ca8071e705be82cdf1207fc0ba8ea3f186f37","observation_id":"f1de9616-1e19-45c5-b74f-7bf75913fd1f","resolution":{"observed_at":"2026-08-15T20:08:56.176954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11462","last_updated":"2025-06-24T03:27:30Z","snapshot_observed_at":"2026-08-16T04:09:22.281715Z","submitted_at":"2025-05-16T17:16:27Z","title":"Disentangling Reasoning and Knowledge in Medical Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11462","snapshot_observed_at":"2026-08-15T20:08:56.179861Z","title":"Disentangling reasoning and knowledge in medical large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:08:56.179861Z"},"links":{"cited_paper":"/paper/2505.11462","citing_paper":"/paper/2506.13102"},"observation_digest":"sha256:c0d043c81cb567c77cbafff9dd7e9e7e5d9d90e84ebb4fb2e63eef97385f97ab","observation_id":"fa72c826-4858-41b7-8118-e88fec1060cb","resolution":{"observed_at":"2026-08-15T20:08:56.179861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.13102","last_updated":"2025-06-16T05:15:53Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-17T20:42:45.472250Z","submitted_at":"2025-06-16T05:15:53Z","title":"Rethinking Test-Time Scaling for Medical AI: Model and Task-Aware Strategies for LLMs and VLMs"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2506.13102."}