Pith. sign in

Paper Citation Record · LEDGER

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction

As of 18 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 1 inbound Pith citation observation for arXiv:2505.12057.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.12057 v1

Coverage vector

measured 40 of 40 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T20:45:42.019150Z

measured 41 of 41 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-08T14:49:53.357083Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-11T18:41:09.640177Z

Reference resolution

40 of 40 outbound references displayed

  • verified exact1
  • verified fuzzy18
  • unresolved21
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation a2f90fcc-96b4-492b-8172-08f5c5a89bf6 · outbound

This paper cites The growing nationwide radiologist shortage: current opportunities and ongoing challenges for international medical graduate radiologists.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction The growing nationwide radiologist shortage: current opportunities and ongoing challenges for international medical graduate radiologists

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:45:42.724065Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:45:41.843413Z digest=sha256:a28f36a878f650d7db510871ee3c29397b565210d7f0645cd5a6e24a9964f3f7

Observation d60bc232-3f71-42db-97fd-b0884e6e1131 · outbound

This paper cites Large-scale validation of the feasibility of gpt-4 as a proofreading tool for head ct reports.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Large-scale validation of the feasibility of gpt-4 as a proofreading tool for head ct reports

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:45:42.708908Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:45:41.848430Z digest=sha256:01037f38827d8921d1aa6df898fcb33caa8ae25dc2da515bf10a6f05ee9b8b43

Observation 693583cc-16d3-4a39-81da-f0a59b209a10 · outbound

This paper cites Potential of gpt-4 for detecting errors in radiology reports: implications for reporting accuracy.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Potential of gpt-4 for detecting errors in radiology reports: implications for reporting accuracy

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:45:42.694733Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:45:41.852928Z digest=sha256:21cf1762e13914872bf5e8547e8b89e85db0ab77bdf9b3792c9ab90a9c7a267e

Observation 88b5b451-9c10-48d8-bb56-84ab74131825 · outbound

This paper cites Diagnostic error and bias in the department of radiology: a pictorial essay.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Diagnostic error and bias in the department of radiology: a pictorial essay

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:45:42.681063Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:45:41.857548Z digest=sha256:dfaccb842d4c8e8161fab26a536e6deab712bce3a6f0633b13c2182cae55429e

Observation b50a4360-2198-4b3e-9975-fda2416d92b0 · outbound

This paper cites Errors in radiology: A standard review.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Errors in radiology: A standard review

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:45:42.667495Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:45:41.862012Z digest=sha256:0ff77c7d16e7311e84a0fcc9a82a3335bc76445617f2217a67777581321450fb

Observation b2b780e9-f312-4f82-a682-3a4efca37b0d · outbound

This paper cites Work overload and diagnostic errors in radiology.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Work overload and diagnostic errors in radiology

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:45:42.653461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:45:41.866513Z digest=sha256:f253a4c2637851a67266e4cf69b051174a44d386c89845b6d4e2cc7fc99f5f8e

Observation 85a820f2-8847-43d0-a6d0-8fff59ae9741 · outbound

This paper cites A Vision-Language Foundation Model to Enhance Efficiency of Chest X-ray Interpretation.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction A Vision-Language Foundation Model to Enhance Efficiency of Chest X-ray Interpretation

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:41.871279Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:41.871279Z digest=sha256:66f0accd30d0255ae4c83f83a0877fdf36f7fe214f1ff29c283effd2b6375b9d

Observation f77eb686-8e43-4cb9-8a16-da352e3bf34c · outbound

This paper cites LLM-CXR: Instruction-Finetuned LLM for CXR Image Understanding and Generation.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction LLM-CXR: Instruction-Finetuned LLM for CXR Image Understanding and Generation

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:41.875809Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:41.875809Z digest=sha256:c6da966ac74a1ed6a7e15d9b92e46979da29a27880d4c4094b4c4f5388dabec9

Observation 5254989f-3e8a-41b5-b972-7dfd5192f0ae · outbound

This paper cites Cross-Modal Causal Intervention for Medical Report Generation.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Cross-Modal Causal Intervention for Medical Report Generation

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:41.880132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:41.880132Z digest=sha256:bd7eb0a7d7d499c6fa8b764211f2451bddb2a998544dc17d7ea53ac74ddb3beb

Observation 4c1f2033-e96d-430f-a633-e02a8742b8b5 · outbound

This paper cites Collaboration between clinicians and vision–language models in radiology report generation.Nature Medicine, 31(2):599–608, 2025.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Collaboration between clinicians and vision–language models in radiology report generation.Nature Medicine, 31(2):599–608, 2025

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:41.884867Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:41.884867Z digest=sha256:f5697a25347812080bc575ed164c27e916e2fbc3da82f6c5d515ae5a6154b0ea

Observation 8bb44e85-6449-4157-b129-eb74df90b885 · outbound

This paper cites Dacg: Dual attention and context guidance model for radiology report generation.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Dacg: Dual attention and context guidance model for radiology report generation

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:45:42.630074Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:45:41.889335Z digest=sha256:c620117ac27fe665bc1d8256fa8d92573d78b4978c63b59d7e439ed1caf9a4d4

Observation 4ea07e03-1b34-43c8-bc2b-e2f1fbb73532 · outbound

This paper cites Enhancing LLMs for Impression Generation in Radiology Reports through a Multi-Agent System.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Enhancing LLMs for Impression Generation in Radiology Reports through a Multi-Agent System

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:41.893781Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:41.893781Z digest=sha256:6ca1962382227849f08a3b0b364229b01f0447c743267eaa91aa457ebe0fe6c6

Observation 74cd184b-43f8-48bb-b7e8-befe31caf35d · outbound

This paper cites Large language models for error detection in radiology reports: a comparative analysis between closed-source and privacy-compliant open-source models.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Large language models for error detection in radiology reports: a comparative analysis between closed-source and privacy-compliant open-source models

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:45:42.614690Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:45:41.898681Z digest=sha256:ec4f149230822ce9cb2dcf8a6c5c2ee3d84e94374ff2d5d87512a9b29e0655e7

Observation 32694e39-2ce5-4901-86d3-7aab24c34421 · outbound

This paper cites The use of large language models in detecting chinese ultrasound report errors.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction The use of large language models in detecting chinese ultrasound report errors

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:45:42.599000Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:45:41.902887Z digest=sha256:8b441f76ff0e000d3ab341153821bf0a7ff437b5d00f1722d66558ab5586b880

Observation 835b208b-26c3-4703-b152-c6a27a17057c · outbound

This paper cites Radiology report expert evaluation (rexval) dataset, 2023.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Radiology report expert evaluation (rexval) dataset, 2023

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:45:42.584195Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:45:41.907259Z digest=sha256:3f8ea61578d73db458757e2d1fdc91199d9c5685bd999548e91b5a0ac19fbf47

Observation 1242929a-6718-4bd7-8e1d-a70ff8551faf · outbound

This paper cites Radiology report generation models evaluation dataset for chest x-rays (RadEvalX).

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Radiology report generation models evaluation dataset for chest x-rays (RadEvalX)

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:45:42.569649Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:45:41.911575Z digest=sha256:d62597ee69f3f4a55c0f2eb28254e2562a2c3c58926936f4d67df8104d6744ec

Observation 415920d8-bc2f-4a5b-b2ce-b0fe9b3b9f95 · outbound

This paper cites RRED: a radiology report error detector based on deep learning framework.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction RRED: a radiology report error detector based on deep learning framework

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:45:42.555044Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:45:41.916084Z digest=sha256:ba153cd21e512eb4ea67cfc36ad9bb0512df83499ea89c788716a3c11a9200d9

Observation 84990f18-84dd-46d2-96ad-082d23afc87e · outbound

This paper cites ReXErr: Synthesizing clinically meaningful errors in diagnostic radiology reports.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction ReXErr: Synthesizing clinically meaningful errors in diagnostic radiology reports

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:45:42.539975Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:45:41.920295Z digest=sha256:5a52e1e1e2414e4bbb3e4d9617cda0bfdb701bc3fc718351f9ef0d29e2dc9f07

Observation 9c95da45-f746-4dfc-ae2e-510dfa4a683f · outbound

This paper cites Mimic-cxr, a de-identified publicly available database of chest radiographs with free-text reports.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Mimic-cxr, a de-identified publicly available database of chest radiographs with free-text reports

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:41.924482Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:41.924482Z digest=sha256:51b00944a6d79683c314fd15299f85faa3758236f127d101a4b7e23f953a0b1b

Observation c2bc4636-1949-41af-8708-783c077b22e7 · outbound

This paper cites Chest x- ray report generation through fine-grained label learning.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Chest x- ray report generation through fine-grained label learning

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:45:42.515901Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:45:41.928936Z digest=sha256:33af5eab66b66b1fd1214cfcc971a38263ebc581f530ce6b65dc40e0779945f9

Observation 4e766b9b-ce73-44ad-99f7-10459651f598 · outbound

This paper cites Automated radiographic re- port generation purely on transformer: A multicriteria supervised approach.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Automated radiographic re- port generation purely on transformer: A multicriteria supervised approach

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:45:42.501120Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:45:41.933270Z digest=sha256:a005a38cfb3230010df9104de6ca6ca3e13685d63eb5d683914f581c8c905262

Observation 7369e2e6-5be0-44f1-8001-2652600a97f2 · outbound

This paper cites Writing by Memorizing: Hierarchical Retrieval-based Medical Report Generation.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Writing by Memorizing: Hierarchical Retrieval-based Medical Report Generation

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:41.937502Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:41.937502Z digest=sha256:7b3aecd380cad3e134801ec4d10cbade75e13991edbc5a2f61e26e41bcb6da5c

Observation a2e5a15a-f964-4a5b-9514-4b5cf520a7bb · outbound

This paper cites Retrieval- based chest x-ray report generation using a pre-trained contrastive language-image model.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Retrieval- based chest x-ray report generation using a pre-trained contrastive language-image model

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:45:42.486667Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:45:41.942157Z digest=sha256:a5d16684db52b232b0f734d5e7f4a5da6152e51d0a026bde71ca41dd742042e7

Observation fe719b4c-6cc9-4f73-bcee-915b1474473d · outbound

This paper cites ReXrank: A Public Leaderboard for AI-Powered Radiology Report Generation.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction ReXrank: A Public Leaderboard for AI-Powered Radiology Report Generation

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:41.946558Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:41.946558Z digest=sha256:16a27c4bf2dc8af78a0d858fc14f773d0fb66154698d288c03304dfed35fac3b

Observation da230c29-0ab9-417c-ac2d-09046bffbe5d · outbound

This paper cites Rouge: A package for automatic evaluation of summaries.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Rouge: A package for automatic evaluation of summaries

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:41.951182Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:41.951182Z digest=sha256:67ad0c1fa987fa2f7226038af08e15762b9bd6a6dec21b48839d07c924037fcb

Observation 0ac73cbf-bf37-453c-bcf6-eedbf90d4cc1 · outbound

This paper cites Bleu: a method for automatic evaluation of machine translation.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Bleu: a method for automatic evaluation of machine translation

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:41.955174Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:41.955174Z digest=sha256:adc2457665e5a7e3e6d9d106493139b8a75c219e1c294e4f8ca3f6c34762bac4

Observation b47042c6-b656-4ade-9011-3fb648817359 · outbound

This paper cites CheXbert: Combining Automatic Labelers and Expert Annotations for Accurate Radiology Report Labeling Using BERT.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction CheXbert: Combining Automatic Labelers and Expert Annotations for Accurate Radiology Report Labeling Using BERT

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:41.959153Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:41.959153Z digest=sha256:1b1f5b17887c412dce57a73e5f7c6aa1050af8f95205ff8fed5f4373c4cb4eea

Observation 666cfcf1-08a0-4534-8ac5-88c0a4acb718 · outbound

This paper cites Evaluating progress in automatic chest x-ray radiology report generation.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Evaluating progress in automatic chest x-ray radiology report generation

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:45:42.453793Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:45:41.963911Z digest=sha256:a4c9237d5ac8a1c4245ae51e27d85c3fc7be584674c99c7e156d907874935715

Observation 191d015c-bc57-4db4-8312-12b94802fb77 · outbound

This paper cites GREEN: Generative Radiology Report Evaluation and Error Notation.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction GREEN: Generative Radiology Report Evaluation and Error Notation

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:41.968161Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:41.968161Z digest=sha256:799cb41358629307d0c00c760061504ddfefb5b25b2e9c8122b895a5a864ea7a

Observation e9ac5fdf-4c5b-43ab-aa2e-177b1240cebc · outbound

This paper cites Generative Large Language Models Trained for Detecting Errors in Radiology Reports.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Generative Large Language Models Trained for Detecting Errors in Radiology Reports

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-08-15T20:45:42.303604Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:45:41.972776Z digest=sha256:b3055b917f54f55733dd2e3b47b405f7dbfcbb88aecb07bbdb984ec0d306d55e

Observation 0bc1b998-8562-4884-af9a-1aee68e3db1c · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:41.977393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:41.977393Z digest=sha256:2eefee7e6fbef70d61e3aa3db80f9fa6ab855c8c48da158fce8ceb6879d27e12

Observation 74d406bd-7e02-469c-9451-39fb3d4af035 · outbound

This paper cites Proximal Policy Optimization Algorithms.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Proximal Policy Optimization Algorithms

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:41.981918Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:41.981918Z digest=sha256:5db082ab3c67d5c510e2867a2a68b596aee3877000e79e6340e71b9786b5885f

Observation 0fc0e750-1d4f-40eb-b098-5e0d00dd77f9 · outbound

This paper cites MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction MedVLM-R1: Incentivizing Medical Reasoning Capability of Vision-Language Models (VLMs) via Reinforcement Learning

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:41.986352Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:41.986352Z digest=sha256:db2a75be4183a66b7684ebe73b17951bb0ca9592949f32a023864fe0939d46c2

Observation f1a5ce22-164a-4aff-bbf8-479cb12063dd · outbound

This paper cites InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:41.991117Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:41.991117Z digest=sha256:b565fe0d007492d828b84f2faf3f2090b252d020bcd9b8a9e2ba08f206bd27fe

Observation 92925b22-0f3d-421e-9279-99e9dcd70e94 · outbound

This paper cites Baichuan-omni-1.5 technical report.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Baichuan-omni-1.5 technical report

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:41.995569Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:41.995569Z digest=sha256:f4f065b268a9aaefdabe5a1b83ddb3a884c5ca83b17365ae1bf7fe5a7cd7d27b

Observation 29dbe717-be95-4245-b4af-ced72b339a03 · outbound

This paper cites Qwen2.5-VL Technical Report.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Qwen2.5-VL Technical Report

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:42.000445Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:42.000445Z digest=sha256:89b1a5fafdc256ad6a0b0421eeb5b5ad3af593bec5e5ea88ed44089f154939a6

Observation 27a13837-8ef8-47c2-b61b-173ca97a3a10 · outbound

This paper cites GPT-4 Technical Report.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction GPT-4 Technical Report

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:42.005696Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:42.005696Z digest=sha256:9b1ea25fddaa095b84694c15eea0942a2fd0d4e81c19ed4f6f72bd2ba475518d

Observation 3afb02b3-30c3-46cf-a6a4-15bc650dacd7 · outbound

This paper cites Introducing openai o3 and o4-mini.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction Introducing openai o3 and o4-mini

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T20:45:42.438956Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-15T20:45:42.010417Z digest=sha256:9e23a9564d05b2b0176b0e4d2d4f0072d4212a017605189202181c60dd3e4cf0

Observation 8bb8aac3-1de2-48b8-be6a-946ca8e210f6 · outbound

This paper cites BERTScore: Evaluating Text Generation with BERT.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction BERTScore: Evaluating Text Generation with BERT

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:42.014887Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:42.014887Z digest=sha256:6bed3fa1f96b17082823802ffce40319245127839f30b66965869d5ed2ed1715

Observation 48cabf78-0376-4e4f-8bd5-abffa02c9207 · outbound

This paper cites X-Reasoner: Towards Generalizable Reasoning Across Modalities and Domains.

CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction X-Reasoner: Towards Generalizable Reasoning Across Modalities and Domains

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-15T20:45:42.019150Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-15T20:45:42.019150Z digest=sha256:a3515286aba96729d46a905e6c628c4d88c5a309fe3407ce81bd678a108954e3

Pith citing papers

Observation cd907dbd-47b3-4ad1-aae8-46f4c2f0950f · inbound

CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs cites this paper.

CXR-ContraBench: Benchmarking Negated-Option Attraction in Medical VLMs CorBenchX: Large-Scale Chest X-Ray Error Dataset and Vision-Language Model Benchmark for Report Error Correction

Reference 48

Resolution
malformed identifier
arxiv_id, observed 2026-05-11T18:41:09.654894Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-08T14:49:53.357083Z digest=sha256:805d72faf064538d81873b1a88d4efc1b922a03243cb5c8ce9e5a7411de5feb7