{"as_of":"2026-08-17T18:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1787b554cca1d4e4fee8dcad9ff29d706c87ea18b68aac214f1687e2b9cb6e17","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:12:00.899754Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T18:10:00.725685Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","snapshot_observed_at":"2026-08-16T13:50:22.756408Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models","version":4},"cited_work":{"arxiv_id":"2405.14191","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.14191","snapshot_observed_at":"2026-08-04T01:57:26.797777Z","title":"S-eval: Towards automated and comprehensive safety evaluation for large language models","venue":null,"work_id":"6f1a6a75-1e42-4f95-aff9-2b1045ab9422","year":2025},"citing_paper":{"arxiv_id":"2404.16130","last_updated":"2025-02-19T10:49:41Z","snapshot_observed_at":"2026-08-16T12:38:40.131901Z","submitted_at":"2024-04-24T18:38:11Z","title":"From Local to Global: A Graph RAG Approach to Query-Focused Summarization","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-11T05:10:57.816312Z"},"links":{"cited_paper":"/paper/2405.14191","citing_paper":"/paper/2404.16130"},"observation_digest":"sha256:fcee62f5d419b2f3568a73534ae0c6f1f0a9274931fbee66c8216f21e9888895","observation_id":"246381f3-539f-4c3e-a52a-21eafb6c6b56","resolution":{"observed_at":"2026-08-04T01:57:26.797777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","snapshot_observed_at":"2026-08-16T13:50:22.756408Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14191","snapshot_observed_at":"2026-08-11T16:17:43.479613Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10198","last_updated":"2025-02-07T13:26:18Z","snapshot_observed_at":"2026-08-16T03:43:40.241163Z","submitted_at":"2024-12-13T15:15:24Z","title":"From Allies to Adversaries: Manipulating LLM Tool-Calling through Adversarial Injection","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T16:17:43.479613Z"},"links":{"cited_paper":"/paper/2405.14191","citing_paper":"/paper/2412.10198"},"observation_digest":"sha256:a90a2527f42317ef252769e69e7af029031be1c7b6096a09b415c74d0db59fd7","observation_id":"627f8aad-0086-494d-b7bf-38053d7e8e8c","resolution":{"observed_at":"2026-08-11T16:17:43.479613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","snapshot_observed_at":"2026-08-16T13:50:22.756408Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14191","snapshot_observed_at":"2026-08-10T22:53:20.842188Z","title":"S-Eval: Automatic and Adaptive Test Generation for Benchmarking Safety Evaluation of Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.00517","last_updated":"2024-12-31T16:01:25Z","snapshot_observed_at":"2026-08-17T02:13:31.546943Z","submitted_at":"2024-12-31T16:01:25Z","title":"A Method for Enhancing the Safety of Large Model Generation Based on Multi-dimensional Attack and Defense","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:53:20.842188Z"},"links":{"cited_paper":"/paper/2405.14191","citing_paper":"/paper/2501.00517"},"observation_digest":"sha256:2a46ae6cdfe22868ecd8be0a4d99c7a44acdc4be7534d7cc5e1382577c432eea","observation_id":"3c2d03b5-39a7-4daf-9977-694f7bab023b","resolution":{"observed_at":"2026-08-10T22:53:20.842188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","snapshot_observed_at":"2026-08-16T13:50:22.756408Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14191","snapshot_observed_at":"2026-08-10T20:53:59.898841Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07071","last_updated":"2025-06-02T15:40:42Z","snapshot_observed_at":"2026-08-12T00:45:41.935460Z","submitted_at":"2025-01-13T05:53:56Z","title":"Value Compass Benchmarks: A Platform for Fundamental and Validated Evaluation of LLMs Values","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-10T20:53:59.898841Z"},"links":{"cited_paper":"/paper/2405.14191","citing_paper":"/paper/2501.07071"},"observation_digest":"sha256:cd2772f597cabb466c7063b4c9fe7493ded704f83dbb1d1dbc18d0c2ae69f6fb","observation_id":"b794624a-4476-4186-9a07-f96a5c272ab1","resolution":{"observed_at":"2026-08-10T20:53:59.898841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","snapshot_observed_at":"2026-08-16T13:50:22.756408Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14191","snapshot_observed_at":"2026-08-10T04:37:16.948537Z","title":"S-eval: Auto- matic and adaptive test generation for benchmarking safety evaluation of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.17749","last_updated":"2025-01-29T16:36:53Z","snapshot_observed_at":"2026-08-10T04:50:16.966807Z","submitted_at":"2025-01-29T16:36:53Z","title":"Early External Safety Testing of OpenAI's o3-mini: Insights from the Pre-Deployment Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T04:37:16.948537Z"},"links":{"cited_paper":"/paper/2405.14191","citing_paper":"/paper/2501.17749"},"observation_digest":"sha256:0c9a3ab55efdd2e47189e7a93e795df6b64fe0c9fcbfd1c865a4d40a4fa90a5d","observation_id":"2b96bf4d-ed93-4bed-b67b-095f5ad09327","resolution":{"observed_at":"2026-08-10T04:37:16.948537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","snapshot_observed_at":"2026-08-16T13:50:22.756408Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14191","snapshot_observed_at":"2026-08-09T23:32:16.751706Z","title":"S-eval: Automatic and adaptive test generation for benchmarking safety evaluation of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18438","last_updated":"2025-01-31T15:39:00Z","snapshot_observed_at":"2026-08-15T12:41:49.022255Z","submitted_at":"2025-01-30T15:45:56Z","title":"o3-mini vs DeepSeek-R1: Which One is Safer?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T23:32:16.751706Z"},"links":{"cited_paper":"/paper/2405.14191","citing_paper":"/paper/2501.18438"},"observation_digest":"sha256:b63684e54498a56824b6b4e24f3cf222e85eda10df88056301aafed451c47866","observation_id":"ed2b1a91-fe68-4fd9-8dba-084e3064c9d9","resolution":{"observed_at":"2026-08-09T23:32:16.751706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","snapshot_observed_at":"2026-08-16T13:50:22.756408Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14191","snapshot_observed_at":"2026-08-09T17:36:09.653389Z","title":"S-eval: Automatic and adaptive test generation for benchmarking safety evaluation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-13T11:40:38.215143Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.653389Z"},"links":{"cited_paper":"/paper/2405.14191","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:2a0703e7a6bff6057a9d78b2c53624c77b802f819e2f63ca826b60728c82bcb7","observation_id":"87a1d1c7-2a9d-4572-9231-8c09383047a7","resolution":{"observed_at":"2026-08-09T17:36:09.653389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","snapshot_observed_at":"2026-08-16T13:50:22.756408Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14191","snapshot_observed_at":"2026-08-07T23:35:42.916246Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09670","last_updated":"2025-02-12T22:55:43Z","snapshot_observed_at":"2026-08-14T13:00:35.954303Z","submitted_at":"2025-02-12T22:55:43Z","title":"The Science of Evaluating Foundation Models","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-07T23:35:42.916246Z"},"links":{"cited_paper":"/paper/2405.14191","citing_paper":"/paper/2502.09670"},"observation_digest":"sha256:86835c2c3747a421b24bee2060d478cd5d87bc9aad2203c2028001a3e39e6606","observation_id":"545f1f60-e197-4e43-bff9-c3d1015fdb0b","resolution":{"observed_at":"2026-08-07T23:35:42.916246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","snapshot_observed_at":"2026-08-16T13:50:22.756408Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14191","snapshot_observed_at":"2026-08-16T10:12:00.899754Z","title":"S-eval: Automatic and adaptive test generation for benchmarking safety evaluation of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18838","last_updated":"2025-04-26T07:48:52Z","snapshot_observed_at":"2026-08-17T04:06:12.060099Z","submitted_at":"2025-04-26T07:48:52Z","title":"Toward Generalizable Evaluation in the LLM Era: A Survey Beyond Benchmarks","version":1},"reference_index":179,"source":"pdf_text","source_observed_at":"2026-08-16T10:12:00.899754Z"},"links":{"cited_paper":"/paper/2405.14191","citing_paper":"/paper/2504.18838"},"observation_digest":"sha256:143bf188e24cedebaed4e1618c41f5a4687e7b1b30cc094d0249b038aedff694","observation_id":"aa10d285-7172-43b9-88a1-d48d23867685","resolution":{"observed_at":"2026-08-16T10:12:00.899754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","snapshot_observed_at":"2026-08-16T13:50:22.756408Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14191","snapshot_observed_at":"2026-08-15T23:36:30.053396Z","title":"arXiv preprint arXiv:2405.14191 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04388","last_updated":"2025-05-28T20:14:44Z","snapshot_observed_at":"2026-08-16T19:51:56.501783Z","submitted_at":"2025-05-07T13:13:14Z","title":"The Aloe Family Recipe for Open and Specialized Healthcare LLMs","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T23:36:30.053396Z"},"links":{"cited_paper":"/paper/2405.14191","citing_paper":"/paper/2505.04388"},"observation_digest":"sha256:b37c5317fa34d3d916d18c766cd082f99bef521c5811a8ba1addfe82c5276890","observation_id":"2fe61643-fdf3-4e05-9533-fff34d8e8f5d","resolution":{"observed_at":"2026-08-15T23:36:30.053396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","snapshot_observed_at":"2026-08-16T13:50:22.756408Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14191","snapshot_observed_at":"2026-08-07T10:17:26.844499Z","title":"S-eval: Automatic and adaptive test generation for benchmarking safety evaluation of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11094","last_updated":"2025-10-30T06:22:33Z","snapshot_observed_at":"2026-08-13T12:53:10.459412Z","submitted_at":"2025-06-06T05:50:50Z","title":"The Scales of Justitia: A Comprehensive Survey on Safety Evaluation of LLMs","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:26.844499Z"},"links":{"cited_paper":"/paper/2405.14191","citing_paper":"/paper/2506.11094"},"observation_digest":"sha256:73c947a5fae5b3dc492a282f9f670a7d99639ac2fd1759251a4d5a6fceb4afdd","observation_id":"d4ac6a66-df10-4627-9818-94933ba03a0e","resolution":{"observed_at":"2026-08-07T10:17:26.844499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","snapshot_observed_at":"2026-08-16T13:50:22.756408Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models","version":4},"cited_work":{"arxiv_id":"2405.14191","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.14191","snapshot_observed_at":"2026-08-04T01:57:26.797777Z","title":"S-eval: Towards automated and comprehensive safety evaluation for large language models","venue":null,"work_id":"6f1a6a75-1e42-4f95-aff9-2b1045ab9422","year":2025},"citing_paper":{"arxiv_id":"2508.11222","last_updated":"2025-12-05T05:36:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-15T05:03:26Z","title":"ORFuzz: Fuzzing the \"Other Side\" of LLM Safety -- Testing Over-Refusal","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T23:27:52.438709Z"},"links":{"cited_paper":"/paper/2405.14191","citing_paper":"/paper/2508.11222"},"observation_digest":"sha256:f18696d547b60b864000e910a301e8605027d0133815acf305aa2d15fa21fe1b","observation_id":"303efba4-6986-4882-ab4a-783b4a3ba1d2","resolution":{"observed_at":"2026-08-04T01:57:26.797777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","snapshot_observed_at":"2026-08-16T13:50:22.756408Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14191","snapshot_observed_at":"2026-08-04T12:45:26.905184Z","title":"S-eval: Towards automated and comprehensive safety evaluation for large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.02480","last_updated":"2026-05-27T22:55:59Z","snapshot_observed_at":"2026-08-11T04:44:02.075367Z","submitted_at":"2025-10-02T18:36:10Z","title":"Controlling the Risk of Corrupted Contexts for Language Models via Early-Exiting","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T12:45:26.905184Z"},"links":{"cited_paper":"/paper/2405.14191","citing_paper":"/paper/2510.02480"},"observation_digest":"sha256:110b84be2ccfb0081751fced184a2e0387d8e91f63376b080efdfc0deb4315b1","observation_id":"d7650cbd-c31f-4368-ad84-0f9410e5f121","resolution":{"observed_at":"2026-08-04T12:45:26.905184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","snapshot_observed_at":"2026-08-16T13:50:22.756408Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models","version":4},"cited_work":{"arxiv_id":"2405.14191","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.14191","snapshot_observed_at":"2026-08-04T01:57:26.797777Z","title":"S-eval: Towards automated and comprehensive safety evaluation for large language models","venue":null,"work_id":"6f1a6a75-1e42-4f95-aff9-2b1045ab9422","year":2025},"citing_paper":{"arxiv_id":"2606.07535","last_updated":"2026-04-24T09:29:14Z","snapshot_observed_at":"2026-08-16T17:12:49.371487Z","submitted_at":"2026-04-24T09:29:14Z","title":"Multilingual Refusal Alignment for Safer Large Language Models","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-04T18:09:17.531727Z"},"links":{"cited_paper":"/paper/2405.14191","citing_paper":"/paper/2606.07535"},"observation_digest":"sha256:02010c08db8dc20313b21fd80ca06dc217de82014f1815d2ebbb24adb64bc7cf","observation_id":"1a5121e0-d0c8-4202-a219-9821cb75e50e","resolution":{"observed_at":"2026-08-04T01:57:26.797777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","snapshot_observed_at":"2026-08-16T13:50:22.756408Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models","version":4},"cited_work":{"arxiv_id":"2405.14191","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.14191","snapshot_observed_at":"2026-08-04T01:57:26.797777Z","title":"S-eval: Towards automated and comprehensive safety evaluation for large language models","venue":null,"work_id":"6f1a6a75-1e42-4f95-aff9-2b1045ab9422","year":2025},"citing_paper":{"arxiv_id":"2606.27632","last_updated":"2026-06-26T01:12:02Z","snapshot_observed_at":"2026-08-01T14:50:11.591955Z","submitted_at":"2026-06-26T01:12:02Z","title":"Yuvion LLM: An Adversarially-Aware Large Language Model for Content And AI Safety","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T00:46:03.210076Z"},"links":{"cited_paper":"/paper/2405.14191","citing_paper":"/paper/2606.27632"},"observation_digest":"sha256:45996d1c6953a56113f4f689551bdd847d8164fe5b58b02afdc6dad904e81147","observation_id":"d42ba51f-292d-4d59-8f56-08e25b9b7ef9","resolution":{"observed_at":"2026-08-04T01:57:26.797777Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","snapshot_observed_at":"2026-08-16T13:50:22.756408Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14191","snapshot_observed_at":"2026-08-05T23:46:20.542247Z","title":"S-eval: Towards auto- mated and comprehensive safety evaluation for large lan- guage models.arXiv preprint arXiv:2405.14191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03201","last_updated":"2026-08-04T06:43:04Z","snapshot_observed_at":"2026-08-14T22:49:39.850803Z","submitted_at":"2026-08-04T06:43:04Z","title":"When Refusal Looks Safe: The Refusal-Cue Shortcut in Safety Guard Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T23:46:20.542247Z"},"links":{"cited_paper":"/paper/2405.14191","citing_paper":"/paper/2608.03201"},"observation_digest":"sha256:063f0429d80dce10ee315bba0a9d351f3259dbe8ebe915a615d84289b7bcb519","observation_id":"077f18ff-e8be-4268-a724-7044051ea787","resolution":{"observed_at":"2026-08-05T23:46:20.542247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2405.14191/citation-record","integrity":"/paper/2405.14191/integrity","json":"/paper/2405.14191/citation-record.json","paper":"/paper/2405.14191"},"outbound":[],"paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","latest_version":4,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-16T13:50:22.756408Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2405.14191."}