Pith. sign in

Paper Citation Record · LEDGER

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models

As of 14 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 10 inbound Pith citation observations for arXiv:2412.18947.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2412.18947 v4

Coverage vector

measured 36 of 36 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-11T04:22:52.084114Z

measured 46 of 46 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-14T06:32:32.682623+00:00

measured 10 of 10 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-11T10:18:08.734883Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T14:38:28.969559Z

Reference resolution

36 of 36 outbound references displayed

  • verified exact2
  • verified fuzzy1
  • unresolved33
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation aa473d65-0605-4dbe-a5a6-5ddd948fca16 · outbound

This paper cites , " * write output.state after.block = add.period write newline.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models , " * write output.state after.block = add.period write newline

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:51.974932Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:51.974932Z digest=sha256:88eabb6e6ebbac320e15eae08ab14f424a06d2863483bbd20725d9aa7f45c1fb

Observation 6e2d7b8c-28af-46c5-8145-37fbd8c9f3d8 · outbound

This paper cites write newline.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models write newline

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:51.978311Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:51.978311Z digest=sha256:671ea3b7fc27cc62ee5c1531ec01912d1d41898dfd089a9702ad20aa1508b51c

Observation 500e1f1e-5a0b-4ba9-87fe-ac0fbf925fdd · outbound

This paper cites an unresolved cited work.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-11T04:22:52.458357Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-11T04:22:51.982115Z digest=sha256:67273b1f4d48f593c5c33d391ed173baa224f2878189d63ed04dccb56ff25d76

Observation ec220f59-a8ca-4b08-8204-cdfecc4eb85e · outbound

This paper cites an unresolved cited work.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:51.986175Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:51.986175Z digest=sha256:5eea670cac4fa9cfdc931f480eabc8574e6325efd1d3fec325c10761ad1bca87

Observation 84b98a02-031a-4cd0-9c35-525da82b8b75 · outbound

This paper cites InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:51.988980Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:51.988980Z digest=sha256:a8d6cb81192b5227ba92215717127761d6bd3baa2e2963c3e0d4641d19f00265

Observation d33dbae8-1d57-4a8c-9878-8b92c2244cfa · outbound

This paper cites MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:51.993428Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:51.993428Z digest=sha256:7a52aa57c85153d348beccb4321b0d1a4b54e82578ebc9e5da5f0e41a7508b04

Observation 0b026341-da33-4779-b408-0f5b920fc94b · outbound

This paper cites Few-shot learning for medical text: A systematic review.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models Few-shot learning for medical text: A systematic review

Reference 7

Resolution
verified exact
local_arxiv, observed 2026-08-11T04:22:52.385055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-11T04:22:51.997456Z digest=sha256:95bbffafc032a0813de1f3cef4bbd6b4842fb4d902c9db0d1f6c7807d4a82a40

Observation dbe6d4fc-a215-4b5e-90eb-560cb5121b17 · outbound

This paper cites MedAlpaca -- An Open-Source Collection of Medical Conversational AI Models and Training Data.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models MedAlpaca -- An Open-Source Collection of Medical Conversational AI Models and Training Data

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.000379Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.000379Z digest=sha256:a24605f1fa57fea8fcbf43d5a98414b1da6b8811ddd84e7d6b43853f05eea6a2

Observation cb28b985-06af-43cb-ad36-9e8cd08959cb · outbound

This paper cites Data Collection and Labeling Techniques for Machine Learning.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models Data Collection and Labeling Techniques for Machine Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.003663Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.003663Z digest=sha256:c7f42003133c6399aa3329cb84ffcd3673b6618f24126255444ecfcf7a9b961f

Observation 009a210e-faa4-4f71-b2de-e818d5809a10 · outbound

This paper cites MedExQA: Medical Question Answering Benchmark with Multiple Explanations.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models MedExQA: Medical Question Answering Benchmark with Multiple Explanations

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.006834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.006834Z digest=sha256:91b6b91ca253a2b68c208b8761cba743c77a5c5e601132162101df08c20bcc7e

Observation ff6f7e78-af5a-453f-a981-a9400c54ea1c · outbound

This paper cites H.; Cheatham, M.; Medenilla, A.; Sillos, C.; De Leon, L.; Elepa \ n o, C.; Madriaga, M.; Aggabao, R.; Diaz-Candido, G.; Maningo, J.; et al.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models H.; Cheatham, M.; Medenilla, A.; Sillos, C.; De Leon, L.; Elepa \ n o, C.; Madriaga, M.; Aggabao, R.; Diaz-Candido, G.; Maningo, J.; et al

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-11T04:22:52.446370Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-11T04:22:52.010043Z digest=sha256:014cfb1461e4d052dec361ce738711644e0afe647861c4134a6cb5e7af75e15f

Observation e0740159-2352-467e-bfa5-415517da60a8 · outbound

This paper cites an unresolved cited work.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-08-11T04:22:52.438143Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-11T04:22:52.012931Z digest=sha256:e30cd8e593928e546a2d885e6dfe841204dd9c78bcbb244f8656f87f8f883477

Observation ec1325cb-2eba-4ec2-9bee-2ce55d14d874 · outbound

This paper cites LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models LLaVA-Med: Training a Large Language-and-Vision Assistant for Biomedicine in One Day

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.016057Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.016057Z digest=sha256:7769d38b199ceeac8b6044e7f9552cb0c6defa873d756f96aabf7eca02ee5e2d

Observation 93120263-676b-446c-af1e-99649fc578ef · outbound

This paper cites HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models HaluEval: A Large-Scale Hallucination Evaluation Benchmark for Large Language Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.018731Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.018731Z digest=sha256:ec78c1f7e562ade21c83efeea1ae634205182f493aebd19bc03041803f484b73

Observation 23d7430d-49bc-493f-abd4-d122d1f16c93 · outbound

This paper cites BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.022225Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.022225Z digest=sha256:086710775278e384380eabbabca311c836f125911a98e0a9fb8d12a6f68e419d

Observation 2e09cb56-0dbd-4929-bd9e-494d9019eaac · outbound

This paper cites an unresolved cited work.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models Unresolved cited work

Reference 16

Resolution
unresolved
raw_fallback, observed 2026-08-11T04:22:52.431125Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-11T04:22:52.025858Z digest=sha256:545d1b409b00a01e41604d994baab619288cf5e4f4e4eb64c873bad32105e538

Observation 8aedec1f-4b93-45d6-99f9-6f01747208bc · outbound

This paper cites Visual Instruction Tuning.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models Visual Instruction Tuning

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.028054Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.028054Z digest=sha256:8e8b80ee10adbab9766491949845b0b5e5dfc49db437df1b525476b941f8628c

Observation cf49ac5d-345c-4a9a-9b4b-06db37eedd45 · outbound

This paper cites MMBench: Is Your Multi-modal Model an All-around Player?.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models MMBench: Is Your Multi-modal Model an All-around Player?

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.030378Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.030378Z digest=sha256:f787a0d342e7de4361c8ac61ec4060eabc853e6987bafd63e4cc3fe8261c9fb8

Observation 2659a164-5efb-4615-ab3b-0f86140a454e · outbound

This paper cites Med-HALT: Medical Domain Hallucination Test for Large Language Models.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models Med-HALT: Medical Domain Hallucination Test for Large Language Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.032934Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.032934Z digest=sha256:edbdc4070842d8055a7a4101151ae2ad89ae70341234c7bfaf9e200157c6f56e

Observation d915b980-c5b4-4253-9080-01c451c0300a · outbound

This paper cites an unresolved cited work.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models Unresolved cited work

Reference 20

Resolution
unresolved
raw_fallback, observed 2026-08-11T04:22:52.423241Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-11T04:22:52.035711Z digest=sha256:d3a322a6caf92dd97cf41fb373871aa66661f6afd48387c289bb3643397a39bb

Observation 0c1a9fce-fe9c-484c-b358-6ea9838da3fb · outbound

This paper cites MKRAG: Medical Knowledge Retrieval Augmented Generation for Medical Question Answering.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models MKRAG: Medical Knowledge Retrieval Augmented Generation for Medical Question Answering

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.038183Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.038183Z digest=sha256:86b5a21ca91fac7eee1ccd90c25eb9c2cfb1b81a943e6bf7595b4164e6518f7b

Observation d59d1ffd-dc4a-4f67-9487-d3858e1caa42 · outbound

This paper cites an unresolved cited work.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models Unresolved cited work

Reference 22

Resolution
unresolved
raw_fallback, observed 2026-08-11T04:22:52.414873Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-11T04:22:52.041544Z digest=sha256:c1a65b448a41c463e489ad633fe415021dd7e1a6099662640d71e2ee629c4818

Observation f0942674-01e6-4697-910d-a0735ac08bd0 · outbound

This paper cites Aligning Large Multimodal Models with Factually Augmented RLHF.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models Aligning Large Multimodal Models with Factually Augmented RLHF

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.044403Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.044403Z digest=sha256:9206745072de16da1d67d5aa73d6b14552739fee7af97b5a7b3cfb1718c6bf8b

Observation 9b6e40cc-3132-49b5-9cdd-03338c580724 · outbound

This paper cites Large Language Models for Data Annotation and Synthesis: A Survey.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models Large Language Models for Data Annotation and Synthesis: A Survey

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.047157Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.047157Z digest=sha256:4a5560d188afe3dfb59bfeff811151ee9cf425b94854b8bb3a69964b80ae3a2a

Observation 9c76bf2c-91e1-4a44-9d14-6747bbf1158f · outbound

This paper cites XrayGPT: Chest Radiographs Summarization using Medical Vision-Language Models.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models XrayGPT: Chest Radiographs Summarization using Medical Vision-Language Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.050486Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.050486Z digest=sha256:d5cb24d36beb6a96bf381f6211910bf8e47f064505f7d26e5afb53129cfd61f6

Observation 7f046121-36bb-4d1f-b667-284807b560fc · outbound

This paper cites an unresolved cited work.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models Unresolved cited work

Reference 26

Resolution
unresolved
raw_fallback, observed 2026-08-11T04:22:52.406822Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-11T04:22:52.054463Z digest=sha256:af1b555962464e3469daf8842965dda5d020920e1904013d56ad8bc51dbd738d

Observation ef7a7b2b-55bd-437f-881a-d19cb8b48ede · outbound

This paper cites ChiMed-GPT: A Chinese Medical Large Language Model with Full Training Regime and Better Alignment to Human Preferences.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models ChiMed-GPT: A Chinese Medical Large Language Model with Full Training Regime and Better Alignment to Human Preferences

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.057307Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.057307Z digest=sha256:a113bffcb38d91368c64c15276ebc304f49ecccd87070308ede22587b7ba3107

Observation 6d88da37-d0c8-454a-9ef4-82eb1dcab07f · outbound

This paper cites Safety challenges of AI in medicine in the era of large language models.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models Safety challenges of AI in medicine in the era of large language models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.060368Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.060368Z digest=sha256:1da4f941fc5296c7d2a4e14c1dcf3891097d0f90073111c3f26a8ef76149bf2b

Observation b14a0c86-8da6-427c-bd95-33d68067aaf9 · outbound

This paper cites Towards Generalist Foundation Model for Radiology by Leveraging Web-scale 2D&3D Medical Data.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models Towards Generalist Foundation Model for Radiology by Leveraging Web-scale 2D&3D Medical Data

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.063434Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.063434Z digest=sha256:aa5e637444939fac1f84cb2d161b651b0822ad4392f284fc63bf31fb6318d0e4

Observation 647a93f0-1ab9-4354-af3c-7d1b07101f26 · outbound

This paper cites LVLM-eHub: A Comprehensive Evaluation Benchmark for Large Vision-Language Models.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models LVLM-eHub: A Comprehensive Evaluation Benchmark for Large Vision-Language Models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.066548Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.066548Z digest=sha256:6c81b77fcc9f69697330db12a5baeed624ae2d687e74d1c125c6b3499a28f61e

Observation 007c30ff-fe4a-4b10-82ac-af765790fc9c · outbound

This paper cites mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.069704Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.069704Z digest=sha256:832f1f64d8f119c57a845d6cd9efb342f3003502f6b3e04505b443e275710f61

Observation b9a21b54-6351-4374-9809-2a06294e0c8b · outbound

This paper cites an unresolved cited work.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models Unresolved cited work

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.072642Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.072642Z digest=sha256:15e29e9e9ddcf4bf61bf8d9412bd634a354670a2d93bcc093039b5967f17488f

Observation 27021c6f-b395-4f26-8783-31b444739187 · outbound

This paper cites A Survey of Large Language Models.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models A Survey of Large Language Models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.075127Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.075127Z digest=sha256:f09309b0dae81b728df5ccc6f0a8937bca0630d533266bb4d84aa9d153b3710a

Observation 7f90c3d7-d9e1-49c8-8113-7c6addc2a085 · outbound

This paper cites MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.077949Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.077949Z digest=sha256:9c942cb22344909ca513c362ce6fd6d3f2bbced64ce333b11fe28deb8a4f2a22

Observation 9b8b2766-b253-4acd-87cd-8976f0bdebc5 · outbound

This paper cites KG4Diagnosis: A Hierarchical Multi-Agent LLM Framework with Knowledge Graph Enhancement for Medical Diagnosis.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models KG4Diagnosis: A Hierarchical Multi-Agent LLM Framework with Knowledge Graph Enhancement for Medical Diagnosis

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-11T04:22:52.081151Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T04:22:52.081151Z digest=sha256:e2c13638889a1487871fcec21219955b440550b287a1a82ab6c9cc5f47ead0ed

Observation 71201a5c-b555-44dc-a4b9-1a45bd895829 · outbound

This paper cites Satisfactory Medical Consultation based on Terminology-Enhanced Information Retrieval and Emotional In-Context Learning.

MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models Satisfactory Medical Consultation based on Terminology-Enhanced Information Retrieval and Emotional In-Context Learning

Reference 36

Resolution
verified exact
local_arxiv, observed 2026-08-11T04:22:52.114395Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-08-11T04:22:52.084114Z digest=sha256:ef2b1be86da1a936cf8b2de5168759b8b91b73bbe6b3757a8185d8ce3351e36c

Pith citing papers

Observation 7ad24faa-0347-4752-9904-db3e9fdf834a · inbound

KG4Diagnosis: A Hierarchical Multi-Agent LLM Framework with Knowledge Graph Enhancement for Medical Diagnosis cites this paper.

KG4Diagnosis: A Hierarchical Multi-Agent LLM Framework with Knowledge Graph Enhancement for Medical Diagnosis MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-11T10:18:08.734883Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-11T10:18:08.734883Z digest=sha256:943c84e41ebac31d2277fba2429b7be683a1c98a1b876088213a566dfdda60a4

Observation dd44847f-7dc3-4363-a261-9311cbbb39d0 · inbound

Loki's Dance of Illusions: A Comprehensive Survey of Hallucination in Large Language Models cites this paper.

Loki's Dance of Illusions: A Comprehensive Survey of Hallucination in Large Language Models MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models

Reference 200

Resolution
unresolved
no resolver link, observed 2026-08-07T10:19:11.288187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T10:19:11.288187Z digest=sha256:b0b40016fe0ab7f3b1f7848a4c6d607ef93df3e8541a9bce973eb4c8aeff5b33

Observation 04ce2e7e-d737-4d09-b44d-e3a85a5e8824 · inbound

A comprehensive taxonomy of hallucinations in Large Language Models cites this paper.

A comprehensive taxonomy of hallucinations in Large Language Models MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models

Reference 109

Resolution
unresolved
no resolver link, observed 2026-08-06T05:29:21.056789Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T05:29:21.056789Z digest=sha256:0966af2e9be2c9d2a5fcf380e7bd8c19589cc2b493c9f1ccaf15dbf5e751042d

Observation 038607a1-13e2-41aa-a690-ab5f2d7550b7 · inbound

TerraMAE: Learning Spatial-Spectral Representations from Hyperspectral Earth Observation Data via Adaptive Masked Autoencoders cites this paper.

TerraMAE: Learning Spatial-Spectral Representations from Hyperspectral Earth Observation Data via Adaptive Masked Autoencoders MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-05T22:26:40.829467Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:26:40.829467Z digest=sha256:58b497ad002477b53f7b2ccf5896522ff9a5405844cf68ea661d7d7c4198a660

Observation baa9a7b1-57c2-4848-91ed-e9d0ce1365f3 · inbound

Trustworthy Medical Imaging with Large Language Models: A Study of Hallucinations Across Modalities cites this paper.

Trustworthy Medical Imaging with Large Language Models: A Study of Hallucinations Across Modalities MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-05T22:26:06.534145Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:26:06.534145Z digest=sha256:c8bae034705bbdccb559f358d415b9394098b9f4808f8ce1c27a2aba8090d2f0

Observation 456e0b79-1c9f-4d9e-b161-5bfb1f2679aa · inbound

A Multi-Task Evaluation of LLMs' Processing of Academic Text Input cites this paper.

A Multi-Task Evaluation of LLMs' Processing of Academic Text Input MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models

Reference 53

Resolution
unresolved
no resolver link, observed 2026-08-05T19:49:52.789854Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T19:49:52.789854Z digest=sha256:de3754873e3dd53049a0d2a482ba5c1517e3ae601cb116763b10bcd3c139c97d

Observation f75f4bb8-a881-4007-bea9-ad58fdb4dc7d · inbound

PARALLAX: Separating Genuine Hallucination Detection from Benchmark Construction Artifacts cites this paper.

PARALLAX: Separating Genuine Hallucination Detection from Benchmark Construction Artifacts MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-19T20:12:44.896323Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=arxiv_source observed=2026-05-19T20:09:47.750043Z digest=sha256:8792d5984273829a63525a5d99b4d2157ba5ffffb8a7dd8df7a2c239c54ba017

Observation 1e92785f-c4af-4572-bda8-1688b7c71bfa · inbound

ERRORQUAKE: Heavy-Tailed Error Severity Distributions in Open-Weight Large Language Models cites this paper.

ERRORQUAKE: Heavy-Tailed Error Severity Distributions in Open-Weight Large Language Models MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-07-12T20:40:22.043187Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-12T20:40:22.043187Z digest=sha256:757d27e39c600bbaa0f02255197b86d895e37a832ab2f35f8f9b353d6a137715

Observation be9bd705-9c52-4a50-8ad7-ff9c51334350 · inbound

Hallucination in Medical Imaging AI: A Cross-Modality Analytical Framework for Taxonomy, Detection, and Mitigation under Regulatory Constraints cites this paper.

Hallucination in Medical Imaging AI: A Cross-Modality Analytical Framework for Taxonomy, Detection, and Mitigation under Regulatory Constraints MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models

Reference 45

Resolution
verified exact
arxiv_id, observed 2026-07-03T14:38:28.970985Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.

source=pdf_text observed=2026-06-27T07:00:54.990637Z digest=sha256:c0160f4a8608102aef7db6cdd2a7615c9a187ca8d65256766c5999b985b41bf0

Observation eff9e784-fec0-4680-a789-70fef4a19c29 · inbound

KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation cites this paper.

KnowHal: A Knowledge-Driven Benchmark for Comprehensive Multimodal Hallucination Evaluation MedHallBench: A New Benchmark for Assessing Hallucination in Medical Large Language Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-05T12:40:15.241605Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T12:40:15.241605Z digest=sha256:b635d66e980ac04ca428fb0afe5cecfaf64af3168487d104f7248dd3308d8952