{"as_of":"2026-08-17T21:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f041d020c48fab586907c08b5ddeb6cb32a822a69fae87f7931b677ee371d1b","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:58:23.582455Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T14:22:59.871835Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T23:26:22.412806Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"cited_work":{"arxiv_id":"2505.11365","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11365","snapshot_observed_at":"2026-07-01T23:26:22.412806Z","title":null,"venue":null,"work_id":"2d02d882-870c-4473-befa-c6c4dfca6ab3","year":2025},"citing_paper":{"arxiv_id":"2605.10442","last_updated":"2026-05-12T10:07:26Z","snapshot_observed_at":"2026-08-15T01:56:58.973403Z","submitted_at":"2026-05-11T12:12:28Z","title":"StereoTales: A Multilingual Framework for Open-Ended Stereotype Discovery in LLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-12T04:50:17.399580Z"},"links":{"cited_paper":"/paper/2505.11365","citing_paper":"/paper/2605.10442"},"observation_digest":"sha256:e91e0f3451dc9f5633a221e244e0f92065909e86b7bd8492beb54c60787b23c3","observation_id":"c56154e1-437c-467d-84c5-6551c2ba6d50","resolution":{"observed_at":"2026-05-12T05:51:27.401303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"cited_work":{"arxiv_id":"2505.11365","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11365","snapshot_observed_at":"2026-07-01T23:26:22.412806Z","title":null,"venue":null,"work_id":"2d02d882-870c-4473-befa-c6c4dfca6ab3","year":2025},"citing_paper":{"arxiv_id":"2605.10442","last_updated":"2026-05-12T10:07:26Z","snapshot_observed_at":"2026-08-15T01:56:58.973403Z","submitted_at":"2026-05-11T12:12:28Z","title":"StereoTales: A Multilingual Framework for Open-Ended Stereotype Discovery in LLMs","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T07:20:32.494840Z"},"links":{"cited_paper":"/paper/2505.11365","citing_paper":"/paper/2605.10442"},"observation_digest":"sha256:7c399932d9f3203f1e47bd3382abaaa067de1d31574ab8b12817de1f9ce1f563","observation_id":"54cb252b-82a6-4ecb-aa53-6de33bebd47b","resolution":{"observed_at":"2026-05-13T07:22:29.098528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"cited_work":{"arxiv_id":"2505.11365","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.11365","snapshot_observed_at":"2026-07-01T23:26:22.412806Z","title":null,"venue":null,"work_id":"2d02d882-870c-4473-befa-c6c4dfca6ab3","year":2025},"citing_paper":{"arxiv_id":"2606.02214","last_updated":"2026-06-01T13:14:10Z","snapshot_observed_at":"2026-08-13T19:23:07.814752Z","submitted_at":"2026-06-01T13:14:10Z","title":"Do Gender Cues Affect LLM Value Trade-offs? Evidence from a Controlled Decision Benchmark","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-28T14:22:59.871835Z"},"links":{"cited_paper":"/paper/2505.11365","citing_paper":"/paper/2606.02214"},"observation_digest":"sha256:0057d35a4843f185c4c11a0d56a5496b5540750710ebeb4f80334b79cd83a72c","observation_id":"d0867b60-0991-4aa8-97fe-9f41fdbd871e","resolution":{"observed_at":"2026-07-01T23:26:22.414502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.11365/citation-record","integrity":"/paper/2505.11365/integrity","json":"/paper/2505.11365/citation-record.json","paper":"/paper/2505.11365"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:58:22.422020Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.422020Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:4b3366147ce6d374c7a917c0eede8c1a6e244554c534a681382493b4e5ed8b9b","observation_id":"68ece1d3-290a-4171-a3a9-252040877230","resolution":{"observed_at":"2026-08-15T20:58:22.422020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:26.748146Z","title":"Zico Kolter, Matt Fredrikson, Yarin Gal, and Xander Davies","venue":null,"work_id":"f0fa3f46-5036-4117-a596-0389b21262ae","year":2025},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.457083Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:4a05ec3583f83943105d5255a37060d8657f1be5aaedf51b857c54142233578e","observation_id":"f7dc12d5-3630-4c78-8826-9a560ed840cf","resolution":{"observed_at":"2026-08-15T20:58:26.752239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:22.461240Z","title":"Introducing the next generation of claude, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.461240Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:c7a64b791e8b9d53708b11038395b8af93b9b90a30288682a76ab24f5e8f884e","observation_id":"27701c01-519e-4470-a8b8-712b10a30518","resolution":{"observed_at":"2026-08-15T20:58:22.461240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17550","last_updated":"2025-04-24T13:40:27Z","snapshot_observed_at":"2026-08-16T10:35:07.542501Z","submitted_at":"2025-04-24T13:40:27Z","title":"HalluLens: LLM Hallucination Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17550","snapshot_observed_at":"2026-08-15T20:58:22.465675Z","title":"Hallulens: Llm hallucination benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.465675Z"},"links":{"cited_paper":"/paper/2504.17550","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:9bf14a14f925f338fc11010979cf1c862be60aeb88dfc86fca955a6d5e0acdfc","observation_id":"37fdbe5b-af66-4104-896a-fb76efdacb38","resolution":{"observed_at":"2026-08-15T20:58:22.465675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:22.470626Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.470626Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:8d64107c5654cec16f3cdab962ecaf6312088225158996fa4ced37f0490ab8c9","observation_id":"ca5faf7d-190d-476b-9078-abd312bfcd50","resolution":{"observed_at":"2026-08-15T20:58:22.470626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:22.475293Z","title":"A survey on evaluation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.475293Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:97852b7cc603d34831ab2166d9e022e9c31ccc56d6388622307a80afb2d6ae07","observation_id":"dad83375-0087-497d-b9ee-f52da9973bda","resolution":{"observed_at":"2026-08-15T20:58:22.475293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:26.716259Z","title":"Chatbot arena: An open platform for evaluating llms by human preference","venue":null,"work_id":"51a6ecf7-aed6-428a-904f-f00f89404f51","year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.579920Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:3687fcc3e25fbb57f7c4ef15c1b1372248a5bfb96e42ab98fb121e1c912e736b","observation_id":"37cff377-b37b-42a0-a9d5-b97631ce075f","resolution":{"observed_at":"2026-08-15T20:58:26.720325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:22.584199Z","title":"Bias and fairness in large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.584199Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:d1506cfcbc45020553b41ad772d42af7f9bce44169b0e67613765b3fd303386d","observation_id":"b0d1fb07-752b-46ff-8bd3-3d48b3b5d87f","resolution":{"observed_at":"2026-08-15T20:58:22.584199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:26.553488Z","title":null,"venue":null,"work_id":"ef4799ac-bcad-4dd4-9399-3f7108a58cfe","year":2020},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.589654Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:1904435a3923c7766de3f0c0074e6e8566a540de61ab6c5f6babd152914bae89","observation_id":"1f2c6e74-2a86-40a1-9323-13fe34b7c108","resolution":{"observed_at":"2026-08-15T20:58:26.630867Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T20:58:22.594212Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.594212Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:efe8a355f0dec531118bcd57d7d611e139210a3629656205f91b0fc50ae2b0ca","observation_id":"81e9b029-5f89-48a9-8ce2-3b884f5ca959","resolution":{"observed_at":"2026-08-15T20:58:22.594212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05731","last_updated":"2025-04-18T22:04:46Z","snapshot_observed_at":"2026-08-16T12:57:06.518406Z","submitted_at":"2025-02-19T05:58:52Z","title":"AILuminate: Introducing v1.0 of the AI Risk and Reliability Benchmark from MLCommons","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05731","snapshot_observed_at":"2026-08-15T20:58:22.600182Z","title":"Ailuminate: Introducing v1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.600182Z"},"links":{"cited_paper":"/paper/2503.05731","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:715e910a9efd36a6bc60edc7d99176fbd00d3140bf744d46f2551bcce6eece98","observation_id":"d663f118-099c-497c-80c8-441ebf1cb1de","resolution":{"observed_at":"2026-08-15T20:58:22.600182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-13T06:43:22.011336Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-15T20:58:22.616818Z","title":"A survey on llm-as-a-judge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.616818Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:abc38947045f72656e8f0690030312dac32fa28c5c182d707d087025c58f4eab","observation_id":"1f0bf93d-fa34-4734-83f0-af9dba254228","resolution":{"observed_at":"2026-08-15T20:58:22.616818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08158","last_updated":"2024-08-13T19:51:48Z","snapshot_observed_at":"2026-08-16T15:24:08.530794Z","submitted_at":"2023-06-13T22:07:54Z","title":"Sociodemographic Bias in Language Models: A Survey and Forward Path","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08158","snapshot_observed_at":"2026-08-15T20:58:22.734725Z","title":"Sociodemo- graphic bias in language models: A survey and forward path","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.734725Z"},"links":{"cited_paper":"/paper/2306.08158","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:afd7bdc2048ae1f85201f56f58fdefd089aa3094cc497d0f4829ce307796b525","observation_id":"ec662841-01ab-46c4-bedc-ff6493c958d0","resolution":{"observed_at":"2026-08-15T20:58:22.734725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:26.489155Z","title":"Toxigen: A large-scale machine-generated dataset for adversarial and implicit hate speech detection","venue":null,"work_id":"de4ba1c3-4194-4798-ab77-84726a0eaaa1","year":2022},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.776955Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:b044cfaf65a05398e9d4f931776579e33ddf6ec581629dc9fd14e3dbcdbf1cce","observation_id":"342910a4-d7df-487f-b82c-98edeb9f7e95","resolution":{"observed_at":"2026-08-15T20:58:26.493233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:22.780986Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.780986Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:2b54e4a068265cb65286597d85575a3a2f325a787c1fdbf49189bff5f1632e59","observation_id":"418618c5-6c94-4cf6-b55d-3bee5051e91c","resolution":{"observed_at":"2026-08-15T20:58:22.780986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:26.470432Z","title":"Trustllm: Trustworthiness in large language models","venue":null,"work_id":"2b3b9f64-2a89-4058-ad92-97db70895ab4","year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.785837Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:3b54fafc4c2e84bf53216afd75eb72ce1150e64153b98b348935519ec1252b77","observation_id":"f1c3a57c-86c1-43d6-9ad8-1b81aebc4bfb","resolution":{"observed_at":"2026-08-15T20:58:26.475994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:26.459936Z","title":"Realharm: A collection of real-world language model application failures, 2025","venue":null,"work_id":"015ad289-a434-4c38-b212-c9e13e967252","year":2025},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.790013Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:456b1f640b12be277411e5cce1e2a6f635b1734f355c9c323e5def6f5226c13e","observation_id":"944afae6-dfa7-4b1f-aac2-df919d9b617f","resolution":{"observed_at":"2026-08-15T20:58:26.463664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:22.794386Z","title":"Survey of hallucination in natural language generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.794386Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:80ade440c33544485c731e3b3a437564a22b18c223c60f67e9f33891e2f39eaf","observation_id":"f1578d80-c8b5-4542-8d34-d708abfa94c6","resolution":{"observed_at":"2026-08-15T20:58:22.794386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-13T19:43:49.936776Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-15T20:58:22.829967Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.829967Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:255c166a96e669e6be74bb6d0d51fe3dd476febcae71959c5f41d13403d1005d","observation_id":"c8957c81-9360-4394-9cc4-b3b628e52dc8","resolution":{"observed_at":"2026-08-15T20:58:22.829967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:22.846560Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.846560Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:5c2f0c4ca6a93f6e0c4630e2e6d52269f5d9d9798108321d6a1729f8d51448e0","observation_id":"d66e5ab9-0310-40c8-b55e-6c0234c2a3ac","resolution":{"observed_at":"2026-08-15T20:58:22.846560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10149","last_updated":"2024-02-21T13:52:11Z","snapshot_observed_at":"2026-08-16T15:07:16.573910Z","submitted_at":"2023-08-20T03:30:22Z","title":"A Survey on Fairness in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10149","snapshot_observed_at":"2026-08-15T20:58:22.851139Z","title":"A survey on fairness in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.851139Z"},"links":{"cited_paper":"/paper/2308.10149","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:ddc0678ca951449efad9803cfd249c70310753c5e4569b46eb00c3136f4d1d95","observation_id":"7257b5b9-4503-45e1-8e13-4ad47fb0b72b","resolution":{"observed_at":"2026-08-15T20:58:22.851139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-10T23:10:13.900680Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-15T20:58:22.855640Z","title":"Holistic evaluation of language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.855640Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:c2132c602ef6c103b895c14820f921cff13d3b4f7fd7ba29eb9fb934f58d3e82","observation_id":"aef0beeb-d0b6-4e56-bc9a-aa0e8ae9a766","resolution":{"observed_at":"2026-08-15T20:58:22.855640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:26.275810Z","title":"Truthfulqa: Measuring how models mimic human falsehoods","venue":null,"work_id":"875df213-8d46-4af9-802a-43f7fb7f5b10","year":2022},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.859789Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:23bd1df0c055562fef220afbcdbd27394d13a37c7fba1d450e60d5a6b46f2c55","observation_id":"21f32bcb-b2e1-4bb7-a0f0-3fc4fb99cecb","resolution":{"observed_at":"2026-08-15T20:58:26.382786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T20:58:22.889997Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.889997Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:3c29b6e38232a6aee657df6efb9580c21d941a07af578664426beab731511e73","observation_id":"53f8d2a7-1996-4362-bcff-25dab5fcc7a1","resolution":{"observed_at":"2026-08-15T20:58:22.889997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05374","last_updated":"2024-03-21T00:21:14Z","snapshot_observed_at":"2026-08-02T17:09:20.540788Z","submitted_at":"2023-08-10T06:43:44Z","title":"Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05374","snapshot_observed_at":"2026-08-15T20:58:22.929568Z","title":"Trustworthy llms: a survey and guideline for evaluating large language models’ alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.929568Z"},"links":{"cited_paper":"/paper/2308.05374","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:ae1b3c2b7c974a3447ab73a75485827fc4e3dad6eac40e5eea7ace1c5aadcba6","observation_id":"50f17492-cdcf-439c-ada4-cf7d13590d17","resolution":{"observed_at":"2026-08-15T20:58:22.929568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:22.935928Z","title":"Evaluating and mitigating social bias for large language models in open-ended settings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.935928Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:715f1aad6026032afa460b5336c0f5e2f1beb789524b16b08afb46e6d3fb7bf8","observation_id":"c5e84771-302a-4f4b-800e-d69c9b848d5f","resolution":{"observed_at":"2026-08-15T20:58:22.935928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-08-16T09:07:20.265665Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-15T20:58:22.941182Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.941182Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:68e5df03cb1de17f265df35dc118d996b962d61103e1ce0e497efddf68052136","observation_id":"31715d1d-6d08-4bce-a9c4-51d10df64ec5","resolution":{"observed_at":"2026-08-15T20:58:22.941182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09456","last_updated":"2020-04-20T17:14:33Z","snapshot_observed_at":"2026-07-06T09:13:46.854094Z","submitted_at":"2020-04-20T17:14:33Z","title":"StereoSet: Measuring stereotypical bias in pretrained language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09456","snapshot_observed_at":"2026-08-15T20:58:22.946951Z","title":"Stereoset: Measuring stereotypical bias in pretrained language models","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.946951Z"},"links":{"cited_paper":"/paper/2004.09456","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:ed1b6531d4ce52f2c15c4a49641f4f8dc2c1a4be48fa9041adf5b178861fcf48","observation_id":"5f11291f-c7d4-42e9-a85c-5da84933e0ad","resolution":{"observed_at":"2026-08-15T20:58:22.946951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:26.264227Z","title":null,"venue":null,"work_id":"9f4f1c66-f1fb-491c-8a9b-ab0a3cb43620","year":2020},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:22.985021Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:ddc7e4ef637a7c8a246679c06f686898fb9dd1f2a785dfc31fdf4f376e476034","observation_id":"02dd2c62-950a-41e2-9224-2a3a65c7517a","resolution":{"observed_at":"2026-08-15T20:58:26.267831Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:26.203562Z","title":"Do the rewards justify the means? measuring trade-offs between rewards and ethical behavior in the machiavelli benchmark","venue":null,"work_id":"27866ecd-2161-4a6c-b526-cf56a2840155","year":2023},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.027065Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:de31c51ebe450edf5bd13066d5ca7411b100cb170eb18f8427b69af2e8ed8bbf","observation_id":"565fae21-9038-4836-9923-de71c26abddd","resolution":{"observed_at":"2026-08-15T20:58:26.256689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:25.985015Z","title":null,"venue":null,"work_id":"e032d847-e1a4-48ac-b08d-9358098dd6a9","year":2022},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.031923Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:ee1b14f3f8a35b82ef7e79b8a2d7b805857990249001ff199c9f333a8d8448f8","observation_id":"7623e78d-56c7-4659-9056-57f27fac798d","resolution":{"observed_at":"2026-08-15T20:58:26.055427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:25.973278Z","title":"Discovering language model behaviors with model-written evaluations","venue":null,"work_id":"5c98288e-db7c-4061-8922-27de5c9fb1d3","year":2023},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.036358Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:636c7f94584ca6aa42eb37d59359ed14308a1be683baf82580795b5f5607e97f","observation_id":"0cac9cd7-415d-4c4b-bcc1-3d438050dee6","resolution":{"observed_at":"2026-08-15T20:58:25.977208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:25.877951Z","title":"Gender bias in coreference resolution","venue":null,"work_id":"2f2c6acd-61a9-4751-ad3d-61f111ad633a","year":2018},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.040187Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:a3929ff5192a70eb2de77c346064c3c779066228be09d2610813e970e39cecb0","observation_id":"50a8468f-90f0-4452-9e96-1b1d8d93e372","resolution":{"observed_at":"2026-08-15T20:58:25.965780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:23.049436Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.049436Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:2acda1b4155e4b02352e24c1e88f80138f72b5bd1fac4dd486f0a7a22e5f995c","observation_id":"19a561b3-3cbf-4084-891e-117ef9fd4b1d","resolution":{"observed_at":"2026-08-15T20:58:23.049436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13548","last_updated":"2025-05-10T07:10:46Z","snapshot_observed_at":"2026-08-14T16:46:25.561386Z","submitted_at":"2023-10-20T14:46:48Z","title":"Towards Understanding Sycophancy in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13548","snapshot_observed_at":"2026-08-15T20:58:23.054813Z","title":"Towards understanding sycophancy in language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.054813Z"},"links":{"cited_paper":"/paper/2310.13548","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:b06fb661bdde09df05256574e0d07ab42a2d5e1a988b2817847cf4b4d0a4ca32","observation_id":"827eec0e-4481-409a-a1d1-49c78250da07","resolution":{"observed_at":"2026-08-15T20:58:23.054813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:25.749425Z","title":"I’m sorry to hear that","venue":null,"work_id":"47a0d89e-b7fd-46dc-aafa-5acc28e10554","year":2022},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.096998Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:6c0b2236fc54ee7a3face68b8d16aadf04a8f37fdfb140c44ae706f136e90def","observation_id":"d5e3835e-54b8-479a-8e8a-e22b3ccd1756","resolution":{"observed_at":"2026-08-15T20:58:25.753316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:25.738072Z","title":"Beyond the imitation game: Quantifying and extrapolating the capabilities of language models","venue":null,"work_id":"ec6b7303-9e23-4da3-827e-cc60aa3e120e","year":2022},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.122453Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:35ed03f19f1c89f304630993c631cbe8b7da6f4d3cb2911d5e183b253143dbfb","observation_id":"73f57fc7-8c2e-4a25-92a9-af9169e5a347","resolution":{"observed_at":"2026-08-15T20:58:25.742267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14940","last_updated":"2026-06-28T22:17:10Z","snapshot_observed_at":"2026-08-14T04:57:44.030623Z","submitted_at":"2025-01-24T21:55:14Z","title":"CASE-Bench: Context-Aware SafEty Benchmark for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14940","snapshot_observed_at":"2026-08-15T20:58:23.126958Z","title":"Woodland, and Jose Such","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.126958Z"},"links":{"cited_paper":"/paper/2501.14940","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:cc92d04ba4f09100902aa4f9e90fc59922bf4843b345858fd91647d5744a203d","observation_id":"7e70ce44-f8a9-45d0-9e13-ecaf434d4f01","resolution":{"observed_at":"2026-08-15T20:58:23.126958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-15T20:58:23.131429Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.131429Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:1e7c9ce405f4ab87f750cbeb41e423647a946a54232c6469beb5fe59aea01236","observation_id":"6ef241dc-4c91-45b3-ba6a-cb77bef6c763","resolution":{"observed_at":"2026-08-15T20:58:23.131429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-15T20:58:23.136263Z","title":"Gemma 2: Improving open language models at a practical size","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.136263Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:2a1147829108eb18d50f13601ab45058f159141b5419d733b4161272c6685f09","observation_id":"01a51554-9a68-439a-bf7e-a6a74db97a02","resolution":{"observed_at":"2026-08-15T20:58:23.136263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:23.140949Z","title":"FEVER: a large-scale dataset for fact extraction and VERification","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.140949Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:f5237f3baf88fa0bec9c16ed4fe5ef3b3e8c150db424982c60c6d33b7c28cebd","observation_id":"44a99346-c754-46a1-84b1-f9f862814211","resolution":{"observed_at":"2026-08-15T20:58:23.140949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T20:58:23.180632Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.180632Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:f41f1e8e4e155534a77dde88ea6f6b201fc095e8b15ce62a8736c24d05932e75","observation_id":"4f176b9b-25a5-408c-93b9-396250546100","resolution":{"observed_at":"2026-08-15T20:58:23.180632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T20:58:23.206027Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.206027Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:bd8b353a0acea37bbd13555943c1ad38bb02370cbe5555b64795b1876db63a49","observation_id":"1c9f65bc-bab6-4b89-a79c-e4934645389a","resolution":{"observed_at":"2026-08-15T20:58:23.206027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:23.210910Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.210910Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:efe1a0ce48221e5e768b78a0a01e179f32233a46000de98184be52706b9780e5","observation_id":"eb65cfea-d78f-4b13-8cf3-c682637454e6","resolution":{"observed_at":"2026-08-15T20:58:23.210910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-08-17T10:08:57.374438Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-15T20:58:23.215085Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.215085Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:8289c0aa0958a98509879aa91edf919be037c79a4bd2f40f9add247cf1c965b3","observation_id":"d3db9def-01cd-4792-bf47-2a938be442c0","resolution":{"observed_at":"2026-08-15T20:58:23.215085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18802","last_updated":"2024-11-07T03:14:38Z","snapshot_observed_at":"2026-08-16T14:05:49.647439Z","submitted_at":"2024-03-27T17:48:55Z","title":"Long-form factuality in large language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18802","snapshot_observed_at":"2026-08-15T20:58:23.220001Z","title":"Long-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.220001Z"},"links":{"cited_paper":"/paper/2403.18802","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:1848ee7cfb43a541f4419f01e07ad19473c68bf962d047eee68c88284f228cf8","observation_id":"68e4e313-b78e-46bd-afcc-62d90a6680bd","resolution":{"observed_at":"2026-08-15T20:58:23.220001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:25.684337Z","title":"Grok 2 beta release, 2024","venue":null,"work_id":"25047454-5454-4c1e-a378-a13d7fb62443","year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.248490Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:44827b0cf56d4cc802325335020ef8779b520c18dacfa77bed3efcf72e787a73","observation_id":"80b4ac63-d951-4e69-9590-9d3150fa9b2d","resolution":{"observed_at":"2026-08-15T20:58:25.714577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T20:58:23.265630Z","title":"Qwen 2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.265630Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:3a111cb2ab6414630ef7f0d85d024d9f6d8bb5b90039d671be22b05ffebff9f7","observation_id":"6f0d0134-4f76-46b2-8587-da57fb675f85","resolution":{"observed_at":"2026-08-15T20:58:23.265630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:25.493009Z","title":"Benchmarking large language models for news summarization","venue":null,"work_id":"6e57c1f1-e416-45dc-a565-e6c3b17a442e","year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.271330Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:c0cfc4eba8b72fefcc6cfbab4bf4f9b28a73f05c83dd524e221f95b4dfc59862","observation_id":"52ceed21-98ff-4198-93f9-21c85934d5bb","resolution":{"observed_at":"2026-08-15T20:58:25.590634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.06876","last_updated":"2018-04-18T18:51:00Z","snapshot_observed_at":"2026-08-14T19:24:31.474740Z","submitted_at":"2018-04-18T18:51:00Z","title":"Gender Bias in Coreference Resolution: Evaluation and Debiasing Methods","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.06876","snapshot_observed_at":"2026-08-15T20:58:23.276035Z","title":"Gender bias in coreference resolution: Evaluation and debiasing methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.276035Z"},"links":{"cited_paper":"/paper/1804.06876","citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:524ce73d37c28886884a89ff703404c464f633fbb2bf527d1fd27289e957fdb3","observation_id":"0108029f-5638-4be8-a849-d89763214323","resolution":{"observed_at":"2026-08-15T20:58:23.276035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:25.483944Z","title":null,"venue":null,"work_id":"ebd6cc13-6455-4973-a287-c64ccdb94e79","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.281359Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:c5e70f38b0f67ebd803c4c0ece4774d063ec1edcd5b3ffb66e00792b7fc3d701","observation_id":"316d5d6e-14df-4fdf-9a8e-3e4d76c7be0b","resolution":{"observed_at":"2026-08-15T20:58:25.487278Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:25.473635Z","title":null,"venue":null,"work_id":"cf2e313e-2cd6-4c30-990e-a8315bc0020e","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.286518Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:608058c08efcebf8c4764e78f9f1b4d325a66496a968c356502f08f8c1d3a4fe","observation_id":"a86da833-5d31-404d-ace3-29fd2b4b9edc","resolution":{"observed_at":"2026-08-15T20:58:25.477684Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:25.462455Z","title":null,"venue":null,"work_id":"57be1a34-5a4d-43c1-a1d0-c785bf3769bf","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.291121Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:36f07e26987b7d243d1f9a393a568d28ca0d7965e21bca3bad39571bc654d954","observation_id":"00e4d7e3-bd50-446a-b203-fca0246349e4","resolution":{"observed_at":"2026-08-15T20:58:25.466967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:25.330552Z","title":"Could it be true that {statement}","venue":null,"work_id":"3c4e5835-8e1f-49a9-aa0d-78e60cce954a","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.295912Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:bded04003003308f524ccd6d7e970e03bc5453e8b0a932225bc0584d0817b944","observation_id":"dd182d6b-e759-4b45-a3ba-4dc87319b4e7","resolution":{"observed_at":"2026-08-15T20:58:25.414864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:25.318289Z","title":null,"venue":null,"work_id":"7fdf7730-c1de-4c2c-bd83-6efc29012966","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.315765Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:4eeffc466a4b51e045c21a36c1b81cbb9dc975515506008102a699a1e54008d9","observation_id":"444fe26d-af40-4e02-a79d-b9e8b2d3827e","resolution":{"observed_at":"2026-08-15T20:58:25.323496Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:25.195154Z","title":null,"venue":null,"work_id":"66432e9c-0882-4ff3-bb36-9735827d57d3","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.351282Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:c9471777eb1538ec26219d909305b2fcf3708353ab96b4ff7a8a1d587bfd9402","observation_id":"c7d809ce-bb36-4d59-9f25-8c5251679799","resolution":{"observed_at":"2026-08-15T20:58:25.311344Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:25.038565Z","title":"evaluation","venue":null,"work_id":"7264047b-a912-4298-bf80-76e509cf325c","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.378245Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:e9211f74008bcb74a00b2e984645c8b006d4fc0fada5c00c81a9bb025c896a04","observation_id":"accd1c50-afa7-4249-8712-3e59283eed48","resolution":{"observed_at":"2026-08-15T20:58:25.041881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:25.028688Z","title":null,"venue":null,"work_id":"fc500212-d6b6-4898-9652-9a2f7b93c65c","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.383330Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:ece3eaa6027842127c331223b84e39147a05db2941b860931eb5ba4c91733843","observation_id":"6cb35476-f782-43c1-8948-dea603db48b2","resolution":{"observed_at":"2026-08-15T20:58:25.032542Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:25.000313Z","title":"If any of these points is true even if partially or indirectly, the assistant is being helpful and raising awareness","venue":null,"work_id":"b46f06ea-45b5-4d3b-968b-12b5db70a1ac","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.386904Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:f7de13d7fd10b5f5aff13db61669c8f2b9503a6bf847f4d22be6d650a9543b16","observation_id":"07e1e8a9-5386-4e34-8892-7a5accce1e50","resolution":{"observed_at":"2026-08-15T20:58:25.021643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:24.895461Z","title":"harmful\" to False if the assistant is being helpful and raising awareness according to the previous point. Otherwise, set","venue":null,"work_id":"c3a0eff8-d31f-4368-bb66-0baa74a54b47","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.390952Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:4a67f06e2805cd2c1799937880114055b414b515350759b3d8d1d9d1c9c67c87","observation_id":"8851b0a2-fba0-4bfd-ad12-1db391245774","resolution":{"observed_at":"2026-08-15T20:58:24.917966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:24.884093Z","title":null,"venue":null,"work_id":"4197b0d6-761c-44a3-aa7d-339622aedfa0","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.394953Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:06451ef1a7df96014ca05311fd93cb51a4f3b259e6742ae6093235d078642412","observation_id":"d41dac98-d1a2-4666-9da5-eabe25b45d80","resolution":{"observed_at":"2026-08-15T20:58:24.887659Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:24.872932Z","title":"unknown\". Clearly state your reasoning for each attribute. For example: {","venue":null,"work_id":"6173ccf2-ef2e-4e4e-9c31-c758de6c01b6","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.399453Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:4472690f5ef2a8074c1f0e13cd223b3e558751828931936d683a0467bb77864a","observation_id":"022cd548-aa64-44c1-99e8-df70a726e3d5","resolution":{"observed_at":"2026-08-15T20:58:24.877128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:24.745719Z","title":"unkown\" otherwise. To perform this extraction, we used two models: GPT-4o-mini and Gemini 2.0 Flash, and set the attribute value to","venue":null,"work_id":"9b5fdcfa-75e5-4b95-acb9-c58ccb1c3781","year":2010},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.407466Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:1058248e3057772a10e314ae2a4b797528d2905642af88d4b715fd3cee9cee93","observation_id":"7d76e9a1-96da-49de-8289-7a358598b671","resolution":{"observed_at":"2026-08-15T20:58:24.866790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:24.617900Z","title":null,"venue":null,"work_id":"749c7fe8-61cc-4e2f-b70d-082fc44c16c7","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.448724Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:429259ed731334a9fef0cafcec393c29c942b0d3273dd3e71ac0625a72f869e8","observation_id":"f765780a-6854-4b68-a817-8387b85bd548","resolution":{"observed_at":"2026-08-15T20:58:24.636058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:24.607284Z","title":"as mentioned in the article","venue":null,"work_id":"41014ce0-fa53-46d7-94ea-8a072ee0b85a","year":2019},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.491371Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:204e9f5b7754d75b469161b095ac35e027498b5183e6c7485bb4ce05ddde4958","observation_id":"bf875316-bb25-4b15-b1d8-df487efd614a","resolution":{"observed_at":"2026-08-15T20:58:24.611952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:24.594382Z","title":"YYYY-MM-DD","venue":null,"work_id":"9a464a4f-a830-428c-ab5e-3d0fe42533ce","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.494713Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:245149957fbfd0a7dbadf170579822f27081dcadc1d8c8b9557f4d5dee2ca6d2","observation_id":"34b4cd76-1910-48fb-b7ac-5726725ac178","resolution":{"observed_at":"2026-08-15T20:58:24.599335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:24.388276Z","title":null,"venue":null,"work_id":"7a277a81-5d2f-4b38-9241-4d1a57612d68","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.498382Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:b7d04515f8303eb9e523127ab81bd356890790cc16a5a33e09e84e57ea5e3f49","observation_id":"0d11020d-1483-428c-8737-b450a80282a9","resolution":{"observed_at":"2026-08-15T20:58:24.469235Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:24.376969Z","title":"If not, edit the question to make it compliant","venue":null,"work_id":"4e3194d1-76d5-4ccb-ad51-eff5a6e46f94","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.501714Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:10d459da862b5490598ee1035916ec9329ce1ad37c5fd827425ab7b456d07dba","observation_id":"6c9f2bbe-570b-4d29-8293-cb18a1d1c57e","resolution":{"observed_at":"2026-08-15T20:58:24.380641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:24.365704Z","title":"analysis","venue":null,"work_id":"8215b3a6-7c37-4d37-b476-ae69f71a8112","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.505650Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:89b1abcda416347f80ebddd207c15d104a3c927c7359317a117342dae44183cf","observation_id":"3b679279-0a35-4b48-a4e7-05058fd019fd","resolution":{"observed_at":"2026-08-15T20:58:24.369578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:24.353514Z","title":null,"venue":null,"work_id":"0b3c4e47-dbfc-4dce-86d8-5814ae9a2991","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.509736Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:57eaee52183fa5f92766fabb3156415e71a6567704e162502f277e8bbee3e717","observation_id":"a26af1a6-7ce4-4a9e-bb1d-d96da43f5274","resolution":{"observed_at":"2026-08-15T20:58:24.357494Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:24.233215Z","title":"You can be creative here, the conversation doesn’t need to be exclusively on topic, but it should be realistic","venue":null,"work_id":"37b59d24-4d79-418e-a94c-80f9b19701ee","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.567191Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:f80668220cf16b79531437a11512733453e8bb60ce7e652e608e8d93c9c7ae5b","observation_id":"ad4c7204-a560-4fc8-9f0b-78a66440d074","resolution":{"observed_at":"2026-08-15T20:58:24.344847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:24.137172Z","title":"Come up with something random","venue":null,"work_id":"ca775133-dbf4-4df0-98e6-9b8ee60df93b","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.570782Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:4ce646334e5b6a2e30f64d74015014d70170f2cccd9b17dc29cfce0da35e946c","observation_id":"b942a2b6-723a-4b86-8769-12be8568b37b","resolution":{"observed_at":"2026-08-15T20:58:24.146555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:24.126299Z","title":"It should start with human and then alternate between the human and the AI","venue":null,"work_id":"41191c48-c573-4b8b-99e3-3232c523bd15","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.574718Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:8042b9381e40d8454501fad84826a75bce48dca375c31a340e027b3d4c1dab58","observation_id":"54e358dd-ab87-493c-bc53-d8f8ebf39f39","resolution":{"observed_at":"2026-08-15T20:58:24.130058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:24.113362Z","title":"HUMAN\" and","venue":null,"work_id":"5c2db294-088f-47ad-958c-c70947ed992d","year":null},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.578590Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:65828cbe9cf51b9aa0dd1474424a7818ef2ee464f739daa6fdd2a2cbf059102a","observation_id":"9c592f7e-52dd-44bd-b1a0-b751cd81ea21","resolution":{"observed_at":"2026-08-15T20:58:24.118053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:58:24.008829Z","title":"The ELO score reflects the human preferences for the models and is computed by comparing multiple answers from different models to a single question","venue":null,"work_id":"2d32418b-f7b8-4d4a-963a-0792586ce7a5","year":2024},"citing_paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T20:58:23.582455Z"},"links":{"citing_paper":"/paper/2505.11365"},"observation_digest":"sha256:bfad3c1a2125714521b91ccb8ff7fd3b5cb734b9fc25902feaa8cb0c2be2898e","observation_id":"1daba3f5-7208-4e0d-858d-36d53dc6dbe1","resolution":{"observed_at":"2026-08-15T20:58:24.105804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.11365","last_updated":"2025-05-26T12:21:14Z","latest_version":4,"primary_category":"cs.CY","snapshot_observed_at":"2026-08-17T12:33:56.295958Z","submitted_at":"2025-05-16T15:31:08Z","title":"Phare: A Safety Probe for Large Language Models"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 3 inbound Pith citation observations for arXiv:2505.11365."}