{"as_of":"2026-08-18T17:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:00bb86b933afa2250070a5250416f5c4a687abe8783f07f242048be36ede243e","coverage":[{"denominator":151,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:15:22.050331Z","state":"measured"},{"denominator":102,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":102,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T19:02:46.991897Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"cited_work":{"arxiv_id":"2506.17163","doi":"10.48550/arxiv.2506.17163","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17163","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The medperturb dataset: What non-content perturbations reveal about human and clinical llm decision making","venue":"ArXiv.org","work_id":"57c582d1-c970-472f-8e5e-7d68b7d766a6","year":2025},"citing_paper":{"arxiv_id":"2605.01048","last_updated":"2026-05-01T19:23:33Z","snapshot_observed_at":"2026-08-11T09:42:32.928404Z","submitted_at":"2026-05-01T19:23:33Z","title":"Compared to What? Baselines and Metrics for Counterfactual Prompting","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-09T19:02:46.991897Z"},"links":{"cited_paper":"/paper/2506.17163","citing_paper":"/paper/2605.01048"},"observation_digest":"sha256:d9deae4c1f4e0da8469dbc75157597ab0917d3bf5602492b4ae05987a2f88cbd","observation_id":"fb758406-220f-4da9-b0e5-e28ca6c4b238","resolution":{"observed_at":"2026-05-09T19:05:10.672097Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"cited_work":{"arxiv_id":"2506.17163","doi":"10.48550/arxiv.2506.17163","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17163","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The medperturb dataset: What non-content perturbations reveal about human and clinical llm decision making","venue":"ArXiv.org","work_id":"57c582d1-c970-472f-8e5e-7d68b7d766a6","year":2025},"citing_paper":{"arxiv_id":"2605.05678","last_updated":"2026-05-07T05:12:56Z","snapshot_observed_at":"2026-08-11T13:45:28.009036Z","submitted_at":"2026-05-07T05:12:56Z","title":"Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T11:49:47.994456Z"},"links":{"cited_paper":"/paper/2506.17163","citing_paper":"/paper/2605.05678"},"observation_digest":"sha256:10521b6e626c0a39bf745d8e4c2d258c78e1d568e3cd81323d26ab7081e20d85","observation_id":"17c60d7f-00ef-42b6-be75-24438d6c3d87","resolution":{"observed_at":"2026-05-11T19:31:08.549200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17163/citation-record","integrity":"/paper/2506.17163/integrity","json":"/paper/2506.17163/citation-record.json","paper":"/paper/2506.17163"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.695152Z","title":"Evaluating large language models on medical evidence summarization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.695152Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:c7600c84f59b0278b5e944882ac91bad31035a210570f46da36fe938ee5a6ccc","observation_id":"9e4ffd32-3ebf-4699-982f-5fcfb0c4ded6","resolution":{"observed_at":"2026-08-15T19:15:21.695152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.699276Z","title":"Adapted large language models can outperform medical experts in clinical text summarization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.699276Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:d223466ab5e523c4bb6b863347efbc0e0ef5cc40796158ef352dc61357de49f0","observation_id":"f4150240-e4d1-44a2-90c9-a862884d2a4d","resolution":{"observed_at":"2026-08-15T19:15:21.699276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01730","last_updated":"2024-01-28T09:25:12Z","snapshot_observed_at":"2026-08-17T05:21:20.498960Z","submitted_at":"2024-01-28T09:25:12Z","title":"Evaluating LLM -- Generated Multimodal Diagnosis from Medical Images and Symptom Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01730","snapshot_observed_at":"2026-08-15T19:15:21.703146Z","title":"Evaluating llm– generated multimodal diagnosis from medical images and symptom analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.703146Z"},"links":{"cited_paper":"/paper/2402.01730","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:b37f2552229c829a5532b0ad653c67914ac5dbf39c2101fd969ae2d54023cf1e","observation_id":"bf3bde49-59c2-4ada-89d2-7e39b1f01e08","resolution":{"observed_at":"2026-08-15T19:15:21.703146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.706939Z","title":"Llm-based agentic systems in medicine and healthcare","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.706939Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:f0dd7c91b9700262a6071718bfa95db881c3ca6a97251883119a7d7d87dd648b","observation_id":"2acbc252-7251-4b32-9fe8-e52d9b257a0b","resolution":{"observed_at":"2026-08-15T19:15:21.706939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02441","last_updated":"2023-12-05T02:44:07Z","snapshot_observed_at":"2026-08-16T14:37:39.068551Z","submitted_at":"2023-12-05T02:44:07Z","title":"MedDM:LLM-executable clinical guidance tree for clinical decision-making","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02441","snapshot_observed_at":"2026-08-15T19:15:21.710633Z","title":"Meddm: Llm-executable clinical guidance tree for clinical decision-making","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.710633Z"},"links":{"cited_paper":"/paper/2312.02441","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:0938c0271dd035313156bd31725fc393f33d562007f1fbcc9a133aae7d21e406","observation_id":"07767479-b3f5-4f23-b0fc-55911580a52b","resolution":{"observed_at":"2026-08-15T19:15:21.710633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.714905Z","title":"Large language models encode clinical knowledge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.714905Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:e5491b129128a89a84fbc4583210c7f474be805194ae1a2338d4d70d6d65bf53","observation_id":"f6e46a8b-8451-40f1-bb9c-4a5c6e56aae5","resolution":{"observed_at":"2026-08-15T19:15:21.714905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.718778Z","title":"Toward expert-level medical question answering with large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.718778Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:0911bb13784c57638469428cfa6c9712db3f760fc1c53bc174e6106fb8cada2a","observation_id":"e9883c0e-2b68-4294-b0a1-ad3bc2e3d75a","resolution":{"observed_at":"2026-08-15T19:15:21.718778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.5679","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:23.017801Z","title":"Luks and Zachary D","venue":null,"work_id":"64e4cc12-36aa-4396-88c3-db863716b65e","year":2021},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.722269Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:f61872b4bdb68692478ce32d11e93dc994627278d19a6944fe8e2c9896f6d50d","observation_id":"3032ad41-4e58-4e07-9730-0e3dda922e41","resolution":{"observed_at":"2026-08-15T19:15:23.025016Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.725660Z","title":"Variability in language used on social media prior to hospital visits","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.725660Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:9ef57dc66aa4e3c37c06e7b6aed3291726d80423a73fae5d90c01299e450599d","observation_id":"604dc004-ab51-4576-b071-c5aacd248574","resolution":{"observed_at":"2026-08-15T19:15:21.725660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.728874Z","title":"How does chatgpt perform on the united states medical licensing examination (usmle)? the implications of large language models for medical education and knowledge assessment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.728874Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:aa55c4ac331c84bbb011ccdc3bcabf2dff50b6f24d6bf8080e890a607f3de68f","observation_id":"3086486e-829f-4e22-a92f-4f862604e9be","resolution":{"observed_at":"2026-08-15T19:15:21.728874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.732634Z","title":"Open medical llm leaderboard","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.732634Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:0ac0c40a9fb89379a05609b3dbb42455d3194d3e93cc1f84810b4a8e9589284c","observation_id":"f7f08073-c5a2-4ebf-810b-3166225e8530","resolution":{"observed_at":"2026-08-15T19:15:21.732634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.736183Z","title":"A rapid review of gender, sex, and sexual orientation documentation in electronic health records","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.736183Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:e121171856b21dbca65f536db5020d0fe45393d10bdf8ef110d9f2b52433c5b9","observation_id":"163ba107-58bb-4b94-9fc5-0faa9c41c254","resolution":{"observed_at":"2026-08-15T19:15:21.736183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.739883Z","title":"Health Care Experiences of Patients with Nonbinary Gender Identities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.739883Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:23c667f6f651981a77432e5178bc687a2a5ba4eba7845a266c774fcf90ae02ad","observation_id":"c1dc0c61-a6ca-4f36-9ccd-88d90607b332","resolution":{"observed_at":"2026-08-15T19:15:21.739883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.747154Z","title":"Hoffmann, Roger B","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.747154Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:4733e5aca0a2571bd8175be663e58005d1822ae09310abe7f99337a4e21efa5b","observation_id":"b054846d-c701-4048-9a16-1075165d6f0e","resolution":{"observed_at":"2026-08-15T19:15:21.747154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1093/heapol/czm026","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:22.286948Z","title":null,"venue":null,"work_id":"6c492f97-755d-4ff9-b10a-d667edfb78f6","year":2007},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.750666Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:ef1f2322a587363fdcd05e63eb3ddae85ff38c015ea6a55fe28dee55e0919718","observation_id":"1cc38915-e466-45da-89d9-9a1fa99bc006","resolution":{"observed_at":"2026-08-15T19:15:22.291183Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.754161Z","title":"Gender disparities in health care","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.754161Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:7c056285a6383c156300fe8e6548eaa42d16435b9032341dfce5fabc9b135dbb","observation_id":"df9834ba-ed33-4765-be03-b5b8f5a6d95f","resolution":{"observed_at":"2026-08-15T19:15:21.754161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.757503Z","title":"Defining gender disparities in pain management","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.757503Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:148ae91c558e471d70d74998c98351be3913f25d00e54d39322ceea59716ee17","observation_id":"b7a80d4a-d602-4a80-a0f8-ac13be4c3c0b","resolution":{"observed_at":"2026-08-15T19:15:21.757503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.760789Z","title":"Gender differences in outcomes of a multimodal pain management program","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.760789Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:a946aab29a5a16a704eb86fd9e3562e8478588e0c44c6c92d3e970d76132354a","observation_id":"80b854cd-ef13-4eb3-91cf-389d54d53754","resolution":{"observed_at":"2026-08-15T19:15:21.760789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.763778Z","title":"Health and healthcare disparities among us women and men at the intersection of sexual orientation and race/ethnicity: a nationally representative cross-sectional study","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.763778Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:97ffdf01fd68a22c78ec582ce2ceff328af86f5d0bba4454b689ce5913899ca1","observation_id":"9b8a5ea0-c979-47fc-b5b8-eeba7f4a7354","resolution":{"observed_at":"2026-08-15T19:15:21.763778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.767181Z","title":"Gender bias in transformers: A comprehensive review of detection and mitigation strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.767181Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:3d73198fa0ade5bf8924c284c32d23f72f94144bfa417ae1fb9bc653f29eeb0b","observation_id":"3ca81320-71ba-4cbe-b4b8-4f2acbfcf452","resolution":{"observed_at":"2026-08-15T19:15:21.767181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.770938Z","title":"Gender bias in natural language processing and computer vision: A comparative survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.770938Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:6b6410edafd93fbeae7b820a87e0aa8033c6455c3d74e5d8373ccf078003bcb9","observation_id":"3818626d-6e34-46af-80ab-5e088208544f","resolution":{"observed_at":"2026-08-15T19:15:21.770938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11100","last_updated":"2023-01-26T13:44:31Z","snapshot_observed_at":"2026-08-16T21:14:03.031406Z","submitted_at":"2023-01-26T13:44:31Z","title":"Vision-Language Models Performing Zero-Shot Tasks Exhibit Gender-based Disparities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11100","snapshot_observed_at":"2026-08-15T19:15:21.774269Z","title":"Vision- language models performing zero-shot tasks exhibit gender-based disparities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.774269Z"},"links":{"cited_paper":"/paper/2301.11100","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:2bdf5d5c6c4a0936d74c853489f7baa6a473eb14df48e0a3e8fa05e57da905ab","observation_id":"eae15c9e-3435-493d-b2cf-5b5970538e03","resolution":{"observed_at":"2026-08-15T19:15:21.774269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.778046Z","title":"Addressing gender-related performance disparities in neural rankers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.778046Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:6280ef6afebacbf01d2780fe0e15bfc5e9552bcb8577d0348d9cfd60e3035bc2","observation_id":"03496300-554e-48c5-8674-3c11f4013c81","resolution":{"observed_at":"2026-08-15T19:15:21.778046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17530","last_updated":"2023-10-26T16:19:19Z","snapshot_observed_at":"2026-08-16T14:48:33.680589Z","submitted_at":"2023-10-26T16:19:19Z","title":"Evaluating Bias and Fairness in Gender-Neutral Pretrained Vision-and-Language Models","version":1},"cited_work":{"arxiv_id":"2310.17530","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.17530","snapshot_observed_at":"2026-08-15T19:15:22.892286Z","title":"Evaluating Bias and Fairness in Gender-Neutral Pretrained Vision-and-Language Models","venue":"cs.CV","work_id":"4f56f8b6-7074-4a4a-bb1d-d88395ae5018","year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.781255Z"},"links":{"cited_paper":"/paper/2310.17530","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:c7020f5cbb3e5fe6910120ead1982555261263fca65046fc951777c4dc624059","observation_id":"5ad8a1c1-fa49-4ea2-89ad-58928594874e","resolution":{"observed_at":"2026-08-15T19:15:22.897241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.784946Z","title":"Bias in bios: A case study of semantic representation bias in a high-stakes setting","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.784946Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:a2e645789a9e45b0b3df66a3990eb24dc7bde406825154c6cdc54b759d87683b","observation_id":"ae8aaac9-2fa7-4bc4-b193-cb82ec9fc32a","resolution":{"observed_at":"2026-08-15T19:15:21.784946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.788803Z","title":"Assessing the potential of gpt-4 to perpetuate racial and gender biases in health care: a model evaluation study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.788803Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:e82321af174e454e83e61d01f03870d11434671945d2ae1bd541535c69dae0f7","observation_id":"b87c217d-1adc-4fbb-b025-c165642ae253","resolution":{"observed_at":"2026-08-15T19:15:21.788803Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15149","last_updated":"2024-04-23T15:52:52Z","snapshot_observed_at":"2026-08-16T13:58:28.651396Z","submitted_at":"2024-04-23T15:52:52Z","title":"Bias patterns in the application of LLMs for clinical decision support: A comprehensive study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15149","snapshot_observed_at":"2026-08-15T19:15:21.792493Z","title":"Bias patterns in the application of LLMs for clinical decision support: A comprehensive study, April 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.792493Z"},"links":{"cited_paper":"/paper/2404.15149","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:a40f4756751157372b392f64050c37e57b3113d83348c65eb326c99680a1a642","observation_id":"8f18a0f6-7c6b-42fc-b0db-22bd40ee9df7","resolution":{"observed_at":"2026-08-15T19:15:21.792493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.796629Z","title":"An investigation into the impact of deep learning model choice on sex and race bias in cardiac mr segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.796629Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:414954ded443ab92a3eee0fe97e222919aa3c9fc3b08e492117c73932c0eb5e6","observation_id":"a2e7c5b1-aa5d-46c0-b7c7-59e788268d01","resolution":{"observed_at":"2026-08-15T19:15:21.796629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.799920Z","title":"Sex and gender differences and biases in artificial intelligence for biomedicine and healthcare","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.799920Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:9797cb318f6bc310efad2cf7590ae923573b00d46d2073bff58192e7cf971927","observation_id":"c5c3ee91-32a4-45ee-a99b-b1b5ed9739cf","resolution":{"observed_at":"2026-08-15T19:15:21.799920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.803345Z","title":"Algorithmic fairness and bias mitigation for clinical machine learning with deep reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.803345Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:67f1c7a0958afb9ab3c708c93774677a9341846713524738318d424154e4e287","observation_id":"a6f76897-4016-44a2-a27b-cd88d1519c10","resolution":{"observed_at":"2026-08-15T19:15:21.803345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.806421Z","title":"Subbalakshmi","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.806421Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:257760c4da91135ee879880298ab6e978b9997f7660ef94441b3763889657c83","observation_id":"06199c94-cb4c-4ba6-9fbb-ce320207cf17","resolution":{"observed_at":"2026-08-15T19:15:21.806421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.809840Z","title":"Gender identification from e-mails","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.809840Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:34644bf06d0102896adeb01c016aba398f6f01352a2fde221b8fbe21adfdf8e0","observation_id":"0028562f-ea4c-4883-9eba-f13b08177cfe","resolution":{"observed_at":"2026-08-15T19:15:21.809840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.814000Z","title":"Gender, pseudonyms, and cmc: Masking identities and baring souls","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.814000Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:a3d28892a38bdbddcf70fb69b5275baeb1e9597a237141dc4b99c3eb2d3e9f55","observation_id":"e852443a-e92c-4b30-8e51-55e8b839eb9a","resolution":{"observed_at":"2026-08-15T19:15:21.814000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1108/09654280810899993/full/html","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:22.270893Z","title":"Bensing, W","venue":null,"work_id":"c82e94d5-fd97-46f8-98ba-b5d021ce9ed4","year":2008},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.817266Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:47e2cf5cc038326eac1cec5b82339273d894e34997f5828c6fe2549cad2689b2","observation_id":"045e3bf8-d25b-43cf-b475-a2694ddc4bca","resolution":{"observed_at":"2026-08-15T19:15:22.274909Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.821718Z","title":"Write it like you see it: De- tectable differences in clinical notes by race lead to differential model recommendations","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.821718Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:b1ff3e5d2a73604169d73f9c7150354af98dbcbd15a56a2b2622d8196c71c555","observation_id":"0ba291eb-fc49-4ed3-8dc2-6a0a506eac05","resolution":{"observed_at":"2026-08-15T19:15:21.821718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.824800Z","title":"Peek, and Elizabeth L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.824800Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:650c700e51755a71f8a56fa89c66002424fcba73dcac0b81f292930b206510d4","observation_id":"6849da2c-e308-4cdc-8854-13aed97681d3","resolution":{"observed_at":"2026-08-15T19:15:21.824800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09219","last_updated":"2023-12-01T19:21:20Z","snapshot_observed_at":"2026-08-16T14:52:18.095948Z","submitted_at":"2023-10-13T16:12:57Z","title":"\"Kelly is a Warm Person, Joseph is a Role Model\": Gender Biases in LLM-Generated Reference Letters","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09219","snapshot_observed_at":"2026-08-15T19:15:21.828030Z","title":"kelly is a warm person, joseph is a role model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.828030Z"},"links":{"cited_paper":"/paper/2310.09219","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:49831ba62667ce024dcdb1e6790686d8864ae3e90c6a8c345757906b250d92bd","observation_id":"03a31317-ae3e-4349-b2e1-c81e3dea94ec","resolution":{"observed_at":"2026-08-15T19:15:21.828030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17083","last_updated":"2025-04-23T20:14:03Z","snapshot_observed_at":"2026-08-16T10:47:48.758541Z","submitted_at":"2025-04-23T20:14:03Z","title":"How Individual Traits and Language Styles Shape Preferences In Open-ended User-LLM Interaction: A Preliminary Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17083","snapshot_observed_at":"2026-08-15T19:15:21.832911Z","title":"How individual traits and language styles shape preferences in open-ended user-llm interaction: A preliminary study","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.832911Z"},"links":{"cited_paper":"/paper/2504.17083","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:cf98533f3d7e2dbcd0593bb46ed2736461e9ba163899c528a30f09a7faa0dd71","observation_id":"83c0a3fe-383c-4e48-adee-edae9b217784","resolution":{"observed_at":"2026-08-15T19:15:21.832911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.836320Z","title":"Closing the gap between open source and commercial large language models for medical evidence summarization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.836320Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:e9eb452a4c70b96a94e7f9bced0dcd9854d2195671edeb0be7c45765ec3e1130","observation_id":"d213c9f1-f684-453a-b1cc-4664fba2219d","resolution":{"observed_at":"2026-08-15T19:15:21.836320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.839288Z","title":"Conversational ai in health: Design considerations from a wizard-of-oz dermatology case study with users, clinicians and a medical llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.839288Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:d4e96e7d5ce9393b62ad0c7747acf76247450c6ff7bde7c00d2ecd6dc81f3f19","observation_id":"0106d6ba-7ded-4ebd-ace1-abd7f29e770a","resolution":{"observed_at":"2026-08-15T19:15:21.839288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.842895Z","title":"Guidelines for rigorous evaluation of clinical llms for conversational reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.842895Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:85e409b446e76d3419c64a681c7498483fb2bb22ad3bc2cf0604ebc09aa85c75","observation_id":"94f25ef1-0ee1-4586-87c7-d207a25eee21","resolution":{"observed_at":"2026-08-15T19:15:21.842895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.846373Z","title":"Effectiveness of a chatbot for eating disorders prevention: a randomized clinical trial","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.846373Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:3c31a29f67794f6b1e564d8321b76086e39d0cb831e2d67ed318add7d2ba992c","observation_id":"5548ce9c-7ed3-40ab-9143-3f46c509df84","resolution":{"observed_at":"2026-08-15T19:15:21.846373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.849693Z","title":"Performance of chatgpt on free-response, clinical reasoning exams","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.849693Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:cb3afeb211fb0f0e16e2adbc7819ea276a0aedb9181af3d88a76c3bddcb2d7e3","observation_id":"d3a0d68d-6fa2-49d8-8688-276dc405dcc2","resolution":{"observed_at":"2026-08-15T19:15:21.849693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.852646Z","title":"The next generation: chatbots in clinical psychology and psychotherapy to foster mental health–a scoping review","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.852646Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:58f1b5e10f70a8de8e9864587dd6b316cf19c79c6d1218fe86f1ef3a04146736","observation_id":"77facdb3-58ac-4d26-8c6b-ab36d281fba9","resolution":{"observed_at":"2026-08-15T19:15:21.852646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.856000Z","title":"Large language model influence on diagnostic reasoning: a randomized clinical trial","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.856000Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:88f6c25222f226adad871eaadbcba3cf1d21a643c7b4dcc466bf5520801cc0b6","observation_id":"95c9aecb-921f-43b6-b917-99702cc6590e","resolution":{"observed_at":"2026-08-15T19:15:21.856000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.859010Z","title":"Human-algorithmic interaction using a large language model-augmented artificial intelligence clinical decision support system","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.859010Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:b65ffd514816666d14ce2068554c698ec1a43fc525f3992c04582e7b33e3aedc","observation_id":"aa7f93a6-87d2-4f5c-a4e9-0565fafd0eac","resolution":{"observed_at":"2026-08-15T19:15:21.859010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17703","last_updated":"2023-11-29T19:10:58Z","snapshot_observed_at":"2026-08-16T14:48:30.304008Z","submitted_at":"2023-10-26T18:03:46Z","title":"The impact of responding to patient messages with large language model assistance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17703","snapshot_observed_at":"2026-08-15T19:15:21.862248Z","title":"The impact of responding to patient messages with large language model assistance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.862248Z"},"links":{"cited_paper":"/paper/2310.17703","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:b2427762247a1a22197a65df3c22d8bf6c4583f82ba7a9f7921775748d6b1657","observation_id":"710a98b7-d38d-4063-b188-482e7675ed7b","resolution":{"observed_at":"2026-08-15T19:15:21.862248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.865790Z","title":"Com- paring physician and artificial intelligence chatbot responses to patient questions posted to a public social media forum","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.865790Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:0d8fb25d915f2afb3f5af3ea6fe7016214a2d5b155db1daf9e675463278868bb","observation_id":"2fda06f4-ea88-4966-b4ff-ebb93d606c84","resolution":{"observed_at":"2026-08-15T19:15:21.865790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.868987Z","title":"An evaluation framework for clinical use of large language models in patient interaction tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.868987Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:41757d94d9e5e60c10350020abba85586cb02a7520c1acb95accc178e7402ecd","observation_id":"6394c0de-e839-4e4b-abff-3253bd9aacad","resolution":{"observed_at":"2026-08-15T19:15:21.868987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.872398Z","title":"The medium is the message: How non-clinical information shapes clinical decisions in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.872398Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:feb821d3ddde4dda75168c65a0f6dd1e078b8f202833723b6698cc3f30c5847f","observation_id":"d492586e-0885-4e5f-8afb-d2f78a5bc812","resolution":{"observed_at":"2026-08-15T19:15:21.872398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.875617Z","title":"Chatgpt: the next-gen tool for triaging? The American journal of emergency medicine, 69:215–217, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.875617Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:871ef4fc05a67790e93718394f6f5654e52d88651af6c1f59cd1994830e1b7ea","observation_id":"938a4e14-eb07-4e1d-b368-9f2a02f7e45a","resolution":{"observed_at":"2026-08-15T19:15:21.875617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.879040Z","title":"The diagnostic and triage accuracy of the gpt-3 artificial intelligence model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.879040Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:12c5e51c15df7932f5bc7997d9607105e1e91a4c6c61b7a6e3ffe2f1d72ed2a3","observation_id":"9328e306-038c-457b-a345-05db4a4a59a5","resolution":{"observed_at":"2026-08-15T19:15:21.879040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.882949Z","title":"Triage performance across large language models, chatgpt, and untrained doctors in emergency medicine: comparative study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.882949Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:5ee8695ff3efb3bc7d947c9caa29b4c17f6b496e14712cc377e262193c766cdb","observation_id":"12b16d0d-408b-4619-a8ce-fcfff8ea9885","resolution":{"observed_at":"2026-08-15T19:15:21.882949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.886354Z","title":"Evaluating llm-based generative ai tools in emergency triage: A comparative study of chatgpt plus, copilot pro, and triage nurses","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.886354Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:07b69aa2820c7f7313772e62ec06535ce304d2e10eb1828f72303a11302cce02","observation_id":"68ccb041-be39-4937-9ebb-fa4b303f0fe6","resolution":{"observed_at":"2026-08-15T19:15:21.886354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.890590Z","title":"Integration of customised llm for discharge summary generation in real-world clinical settings: a pilot study on russell gpt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.890590Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:13a3e317c6c2bd3be36cdfcc290b45cc5e53003936f8fd2922e7a54b1fc60720","observation_id":"e27deeb6-c602-4ad4-9298-7ce0c74f9acb","resolution":{"observed_at":"2026-08-15T19:15:21.890590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.894779Z","title":"A toolbox for surfacing health equity harms and biases in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.894779Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:3c327475d6fc657923900307a21523f4e09295f5908c0d16ede82329d81e4408","observation_id":"126df0af-a510-4147-a76d-a8e726b53b44","resolution":{"observed_at":"2026-08-15T19:15:21.894779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12021","last_updated":"2024-10-07T18:34:56Z","snapshot_observed_at":"2026-08-16T13:51:19.162287Z","submitted_at":"2024-05-20T13:42:27Z","title":"Can AI Relate: Testing Large Language Model Response for Mental Health Support","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12021","snapshot_observed_at":"2026-08-15T19:15:21.898179Z","title":"Can AI Relate: Testing Large Language Model Response for Mental Health Support, October 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.898179Z"},"links":{"cited_paper":"/paper/2405.12021","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:33312c3f808495e02ee70a9982f673be8d3abca7588342369f6e9f9a15e1a99c","observation_id":"793693f4-dc90-4b61-af2a-c9f7fb331166","resolution":{"observed_at":"2026-08-15T19:15:21.898179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.901737Z","title":"A systematic review of large language model (llm) evaluations in clinical medicine","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.901737Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:da6b8e6a1020958753a5fad5b7efaded076fa5742a8ef76ed397719ce9281590","observation_id":"b9b7e40d-e11e-4c60-99bf-3baec94930de","resolution":{"observed_at":"2026-08-15T19:15:21.901737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.904754Z","title":"Evaluating the clinical benefits of llms.Nature Medicine, 30(9):2409–2410, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.904754Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:c5f6bfc28f26e9c7732b7d1a447d18e1426a93440ae5e444597d821bf6c70262","observation_id":"94c15ff3-939c-417a-ac27-d71eee752d28","resolution":{"observed_at":"2026-08-15T19:15:21.904754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13081","last_updated":"2020-09-28T05:07:51Z","snapshot_observed_at":"2026-08-15T11:16:02.015660Z","submitted_at":"2020-09-28T05:07:51Z","title":"What Disease does this Patient Have? A Large-scale Open Domain Question Answering Dataset from Medical Exams","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.13081","snapshot_observed_at":"2026-08-15T19:15:21.908939Z","title":"What disease does this patient have? a large-scale open domain question answering dataset from medical exams, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.908939Z"},"links":{"cited_paper":"/paper/2009.13081","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:eeffbf8447345504ff6ac2bb6c45f610d8222afca2a857a41e8a22c91cbc0486","observation_id":"99398c58-fd04-4ee2-ae43-53757bceb76d","resolution":{"observed_at":"2026-08-15T19:15:21.908939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.06146","last_updated":"2019-09-13T11:18:20Z","snapshot_observed_at":"2026-08-17T06:10:48.003173Z","submitted_at":"2019-09-13T11:18:20Z","title":"PubMedQA: A Dataset for Biomedical Research Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.06146","snapshot_observed_at":"2026-08-15T19:15:21.912397Z","title":"Pubmedqa: A dataset for biomedical research question answering","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.912397Z"},"links":{"cited_paper":"/paper/1909.06146","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:0828e3131551109da4bedbb6fc165ccdec90797efd9e8548c576029b032c20c4","observation_id":"c245a714-1587-4c8f-8e5c-6cf2b428a2d1","resolution":{"observed_at":"2026-08-15T19:15:21.912397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.916224Z","title":"DiversityMedQA: A benchmark for assessing demographic biases in medical diagnosis using large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.916224Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:863cc634a87e27da15fc37fb145c4e8fea2205af33b25fec5c5eea41c476ba45","observation_id":"738c7030-4081-40ec-a74c-732def8691df","resolution":{"observed_at":"2026-08-15T19:15:21.916224Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07314","last_updated":"2026-07-28T17:58:21Z","snapshot_observed_at":"2026-08-16T13:19:25.736790Z","submitted_at":"2024-09-11T14:44:51Z","title":"MEDIC: Comprehensive Evaluation of Leading Indicators for LLM Safety and Utility in Clinical Applications","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.07314","snapshot_observed_at":"2026-08-15T19:15:21.919409Z","title":"Medic: Towards a comprehensive framework for evaluating llms in clinical applications.arXiv preprint arXiv:2409.07314, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.919409Z"},"links":{"cited_paper":"/paper/2409.07314","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:0fb9f8a64a99c57da151663a851ef7bb27fec3f7706fe8453a755cfbccdfa8d8","observation_id":"d9c327ef-6b38-42ba-8014-72870728a54a","resolution":{"observed_at":"2026-08-15T19:15:21.919409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.922867Z","title":"Performance of large language models on medical oncology examination questions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.922867Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:25803e7e4e545b49fc336fe8d26467f3c064bb4626115b73b1c17dc101917db8","observation_id":"829fb1d9-8764-4bb3-946f-44676c6f096a","resolution":{"observed_at":"2026-08-15T19:15:21.922867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10694","last_updated":"2025-03-12T05:08:02Z","snapshot_observed_at":"2026-08-16T12:50:52.991879Z","submitted_at":"2025-03-12T05:08:02Z","title":"Medical Large Language Model Benchmarks Should Prioritize Construct Validity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10694","snapshot_observed_at":"2026-08-15T19:15:21.926256Z","title":"Medical large language model benchmarks should prioritize construct validity","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.926256Z"},"links":{"cited_paper":"/paper/2503.10694","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:177883fbbb1aaa1b6b6bb66c2d2139ffde297f278b70255b70293aac68a32a81","observation_id":"74f6f77b-b65e-4716-83ab-2d26855d1b0b","resolution":{"observed_at":"2026-08-15T19:15:21.926256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-15T19:15:21.930184Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.930184Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:cb0660f1197ec7653d2b791b93c14aac24fcea6a8c0b6389cac374a98a259f40","observation_id":"fd456a41-7389-4100-bd54-ddfb12d613e5","resolution":{"observed_at":"2026-08-15T19:15:21.930184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13006","last_updated":"2025-03-30T17:59:47Z","snapshot_observed_at":"2026-08-18T13:17:17.701561Z","submitted_at":"2024-08-23T11:49:01Z","title":"Systematic Evaluation of LLM-as-a-Judge in LLM Alignment Tasks: Explainable Metrics and Diverse Prompt Templates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13006","snapshot_observed_at":"2026-08-15T19:15:21.934638Z","title":"Systematic evaluation of llm-as-a-judge in llm alignment tasks: Explainable metrics and diverse prompt templates","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.934638Z"},"links":{"cited_paper":"/paper/2408.13006","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:6d46da72659313347303d8fe3f40076abf90b9cdc248b57a3cdbc4301130eea1","observation_id":"f32569ca-49f8-4a11-bbe0-c12970b98b9b","resolution":{"observed_at":"2026-08-15T19:15:21.934638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.939396Z","title":"Automating evaluation of ai text generation in healthcare with a large language model (llm)-as- a-judge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.939396Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:37883d53dde469377880297354a39c9aa7cc02d71e14a38d5ecc869b6bf9847e","observation_id":"b5873111-7447-490b-b0fd-4c507b035507","resolution":{"observed_at":"2026-08-15T19:15:21.939396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.942893Z","title":"Limitations of the llm-as-a-judge approach for evaluating llm outputs in expert knowledge tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.942893Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:f02fa877d73f49a478cdeac395d58bbb3ac11f3262f02f807a47681efdf4629d","observation_id":"aba09d39-5f6d-466b-944b-f6ba8c560a0f","resolution":{"observed_at":"2026-08-15T19:15:21.942893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-15T19:15:21.946197Z","title":"A survey on llm-as-a-judge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.946197Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:d09910506c8623ae08f6f4c381f93f8f85ed32e7a9c9567d4d46c1ef6a52c428","observation_id":"9950664d-9951-4067-b49c-804a0c7f3f1f","resolution":{"observed_at":"2026-08-15T19:15:21.946197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-16T20:55:34.075464Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-15T19:15:21.950376Z","title":"Can large language models be an alternative to human evaluations? arXiv preprint arXiv:2305.01937, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.950376Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:bac11ba9d3e9f21af9a739fdcdf284b18bfab25a24ce69410b893e43963ff471","observation_id":"42676804-f7d6-42ac-bd6e-d2e393d58ebf","resolution":{"observed_at":"2026-08-15T19:15:21.950376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02736","last_updated":"2024-10-04T03:57:47Z","snapshot_observed_at":"2026-08-01T08:21:19.528254Z","submitted_at":"2024-10-03T17:53:30Z","title":"Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02736","snapshot_observed_at":"2026-08-15T19:15:21.953810Z","title":"Justice or prejudice? quantifying biases in llm-as-a-judge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.953810Z"},"links":{"cited_paper":"/paper/2410.02736","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:f6bd91ac872f0ee0d7c46299d5f3535076186edacb8e0fa98583af974fb55122","observation_id":"7d78a3f1-ba94-4a4e-965a-3d604a7b44f3","resolution":{"observed_at":"2026-08-15T19:15:21.953810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12624","last_updated":"2025-08-18T00:07:23Z","snapshot_observed_at":"2026-08-17T19:11:58.232946Z","submitted_at":"2024-06-18T13:49:54Z","title":"Judging the Judges: Evaluating Alignment and Vulnerabilities in LLMs-as-Judges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12624","snapshot_observed_at":"2026-08-15T19:15:21.957520Z","title":"Judging the judges: Evaluating alignment and vulnerabilities in llms-as- judges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.957520Z"},"links":{"cited_paper":"/paper/2406.12624","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:04462621ad27ad7a897cae57dcf1e7c8d83fa6b67db9f2b001ecdc84cc1987c5","observation_id":"b06258f5-6ac2-47b3-8c31-6a6c4f36e4ad","resolution":{"observed_at":"2026-08-15T19:15:21.957520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.961112Z","title":"As- sessment of pathology domain-specific knowledge of chatgpt and comparison to human performance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.961112Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:3dd5c3a4df178490b1565b8a4cfbc94d3bf8922ea32a2d792f393c97289c615c","observation_id":"23e4f448-4fe3-499c-a296-62d0bb0a3edd","resolution":{"observed_at":"2026-08-15T19:15:21.961112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.964430Z","title":"Quality of answers of generative large language models versus peer users for interpreting laboratory test results for lay patients: evaluation study","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.964430Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:1e3dced7ac7ef96f51fc44bc7aba6a03a71e70afd4f433766516e8c9207de0c9","observation_id":"318db684-412b-4da4-8b6b-bd29aad69080","resolution":{"observed_at":"2026-08-15T19:15:21.964430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03025","last_updated":"2023-11-12T06:25:32Z","snapshot_observed_at":"2026-08-16T15:18:13.869023Z","submitted_at":"2023-07-06T14:42:01Z","title":"Style Over Substance: Evaluation Biases for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03025","snapshot_observed_at":"2026-08-15T19:15:21.967504Z","title":"Style over substance: Evaluation biases for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.967504Z"},"links":{"cited_paper":"/paper/2307.03025","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:15486f09080a6d61a29b624a9b030f55a0d3d47cd78f8e2a3a9b1e6e6d9049ca","observation_id":"e8d4c663-c964-4e59-b977-f379e7efeb7b","resolution":{"observed_at":"2026-08-15T19:15:21.967504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.971049Z","title":"Ehrnoteqa: An llm benchmark for real- world clinical practice using discharge summaries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.971049Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:db24872d294303ad8f153ed99ce9dd5a101c083e7d36d9714ef7384eac688286","observation_id":"ad2dbca1-09b4-414e-a234-3694e0db6415","resolution":{"observed_at":"2026-08-15T19:15:21.971049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.974313Z","title":"Tran, Daniel I Schlessinger, Shannon Wongvibulsin, Zhuo Ran Cai, Roxana Daneshjou, and Pranav Rajpurkar","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.974313Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:2e6e197ac504f5b7a1700f9466b089a208b6ff20466c8071b7ceb2a219cea1c7","observation_id":"4ad5a4b3-0cb3-4981-a583-42f4ac9cab04","resolution":{"observed_at":"2026-08-15T19:15:21.974313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T19:15:21.977984Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.977984Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:e7c46c0f9d163e6c7a297d9291f732f209ab9f4a728cc7b65fcd6606887433ad","observation_id":"a2fae7cf-5f85-49f8-b27f-5e8c2047f143","resolution":{"observed_at":"2026-08-15T19:15:21.977984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.980919Z","title":"Linguistic analy- sis of communication in therapist-assisted internet-delivered cognitive behavior therapy for generalized anxiety disorder","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.980919Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:192373223a183a22ac61e7c3798b2051f29584b745fbb98c526ab3b5c41eac3c","observation_id":"0d1bc52a-cb62-4ce3-b0e6-3c1024250754","resolution":{"observed_at":"2026-08-15T19:15:21.980919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.984000Z","title":"Toward linguistic recognition of generalized anxiety disorder","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.984000Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:1661f86f5751d16275b4e6daafb3bde4dee0cf0ccca51a05c3abeb706600ab70","observation_id":"34a263ac-a9f0-4e76-aab2-8184bb42c548","resolution":{"observed_at":"2026-08-15T19:15:21.984000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.987812Z","title":"Linguistic markers of anxiety and depression in somatic symptom and related disorders: Observational study of a digital intervention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.987812Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:1576eeb26585f41c34c79c1ad561dfd16e542d7ea06281f8f9542bd15acf977f","observation_id":"bab69140-78dd-404e-84cf-a0849dea1d7f","resolution":{"observed_at":"2026-08-15T19:15:21.987812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.991152Z","title":"Are patient linguistic tones associated with mental health and perceived clinician empathy? JBJS, 103(23):2181–2189, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.991152Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:0eea34baaf16a38188eab07849852198d56eccec544cb6a1f71dae4eb31b8cca","observation_id":"11dd3167-df4a-4bb8-b04d-32554d1dc644","resolution":{"observed_at":"2026-08-15T19:15:21.991152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T19:15:21.994385Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.994385Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:5614a1558fe69902194b16f5d76aa1994865a4b42a0e91a1087ead2a9c182bdc","observation_id":"56185fba-c4b9-4e81-b80f-3eb7c82ac921","resolution":{"observed_at":"2026-08-15T19:15:21.994385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:21.997880Z","title":"Palmyra-med: Instruction-based fine-tuning of llms enhancing medical domain performance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:21.997880Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:98adf49f7f82da0aa21e3cb8d6c07f225fb56d1c1f79fdbd888de638cc7c598e","observation_id":"860ff5ca-935d-4850-898e-cd23879b55c0","resolution":{"observed_at":"2026-08-15T19:15:21.997880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:22.001808Z","title":"The equivalence of weighted kappa and the intraclass correlation coefficient as measures of reliability","venue":null,"work_id":null,"year":1973},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:22.001808Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:070311b3c859bd9776de85495852a3817f25e4cea587d19cfc779fe9d451f795","observation_id":"1d2fba3d-82ac-4d12-a340-e95bd0f2af14","resolution":{"observed_at":"2026-08-15T19:15:22.001808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:22.005542Z","title":"Multiple significance tests: the bonferroni method","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:22.005542Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:aa6a32acb6474228965781f7e932accce7489796cce4c977baddeebabf45444f","observation_id":"3e6b9251-d1e5-4672-8a36-51befbafa48c","resolution":{"observed_at":"2026-08-15T19:15:22.005542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:22.008516Z","title":"Note on the sampling error of the difference between correlated proportions or percentages","venue":null,"work_id":null,"year":1947},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:22.008516Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:828e7417417299830ca58ebcf76d570d7ca376a7b0c6d1c6e056fc83a6a4b1a4","observation_id":"d9b4bed2-ba0b-42aa-a6a3-bf50ac4e2945","resolution":{"observed_at":"2026-08-15T19:15:22.008516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:22.011752Z","title":"Individual comparisons by ranking methods","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:22.011752Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:6f4d17eb2dfc416e65686d1a0ccf00207690c2a5211291c14964e0d08e0f2cc7","observation_id":"b19016fc-cee7-4c16-b5a6-f9b4178cb3e8","resolution":{"observed_at":"2026-08-15T19:15:22.011752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:22.015339Z","title":"The measurement of observer agreement for categorical data","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:22.015339Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:cf2399b484bb3bd406cbf76e4b4ddff34dcaa5b20adcaff9dc82db19cf4138ba","observation_id":"68fada91-d8d6-4e98-9c56-1fdf01e888d6","resolution":{"observed_at":"2026-08-15T19:15:22.015339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:22.018639Z","title":"On the use and interpretation of certain test criteria for purposes of statistical inference part i","venue":null,"work_id":null,"year":1928},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:22.018639Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:5c4f6fc42bc32cc29597a397f9c62692363e47bf852a9372bd9c12045ab95ea7","observation_id":"15692283-b172-4ac9-99ca-b5000a05cc08","resolution":{"observed_at":"2026-08-15T19:15:22.018639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:22.021993Z","title":"On a test of whether one of two random variables is stochastically larger than the other","venue":null,"work_id":null,"year":1947},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:22.021993Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:cbfa9c16d1ec5a38f3573f467533ad0c7ec5653d984f94999e92cc232fbb65b5","observation_id":"dcf64b46-7631-4460-b53a-9f9cc53a0df0","resolution":{"observed_at":"2026-08-15T19:15:22.021993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:22.024908Z","title":"Gender bias and stereotypes in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:22.024908Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:192071a28b6d7e07c10e29a7130054d00acb6570ac4ee50936faea818c6c0bcf","observation_id":"a72ee610-6d01-4221-8918-e0fe277004d1","resolution":{"observed_at":"2026-08-15T19:15:22.024908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:22.027941Z","title":"Llm evaluators recognize and favor their own generations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:22.027941Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:ccbb280c1abcbfa3e9913891796a794b26db7fb587915a3337d0e450b4b7c6a3","observation_id":"0a2be227-7012-4856-9130-dbed21282f16","resolution":{"observed_at":"2026-08-15T19:15:22.027941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:22.031212Z","title":"Bender and Batya Friedman","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:22.031212Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:d301e982d82ec2fd4ae829336bd0c69a7b32e7a4d4fa046835eb93267226a1ad","observation_id":"b8147dac-cbeb-41b5-8556-710015d964b2","resolution":{"observed_at":"2026-08-15T19:15:22.031212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:22.034556Z","title":"Basic demographics, health practices, and health status of us medical students","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:22.034556Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:40360c1abaf467b657d80447611b89d56f5a96f3f4bae143f1080fc4aee1220c","observation_id":"906af124-436a-4233-a10b-574b49c57199","resolution":{"observed_at":"2026-08-15T19:15:22.034556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:22.037896Z","title":"International medical graduates in the us physician workforce and graduate medical education: current and historical trends","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:22.037896Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:9e84a63c68bb4958042d538c15ea98facd6a0cb22f5e4d077523044bdda9a6de","observation_id":"df7aa351-d8ab-4712-bdc0-a1a192dcd0cd","resolution":{"observed_at":"2026-08-15T19:15:22.037896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:22.041997Z","title":"Clinical reasoning education at us medical schools: results from a national survey of internal medicine clerkship directors","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:22.041997Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:19f95a1743b4a1fd189c53eb0d49576a53b38b7768c3d04e3dcf3324acf60172","observation_id":"ba0cffc4-169b-46d6-b428-a46af3745e46","resolution":{"observed_at":"2026-08-15T19:15:22.041997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:22.046929Z","title":"Teaching medical students the important connection between communication and clinical reasoning","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:22.046929Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:421b963d19807e212dec2ac3f63cabf48e69f85752649ad0079ed5c20bc457c5","observation_id":"27e35414-7bf1-44df-91fa-af90972b99f5","resolution":{"observed_at":"2026-08-15T19:15:22.046929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:15:22.050331Z","title":"Factors associated with medical student clinical reasoning and evidence based medicine practice","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-15T19:15:22.050331Z"},"links":{"citing_paper":"/paper/2506.17163"},"observation_digest":"sha256:12720fa8990b9dbd9068bfb460d402b5bdded258774b960afaa0fb5121b30bc2","observation_id":"335521db-c88c-40fc-a86f-ff80cedd88af","resolution":{"observed_at":"2026-08-15T19:15:22.050331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.17163","last_updated":"2025-06-20T17:09:27Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T13:17:53.397102Z","submitted_at":"2025-06-20T17:09:27Z","title":"The MedPerturb Dataset: What Non-Content Perturbations Reveal About Human and Clinical LLM Decision Making"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":94,"verified_exact":4,"verified_fuzzy":0},"total_outbound_references":151},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 100 of 151 outbound references and 2 inbound Pith citation observations for arXiv:2506.17163."}