{"as_of":"2026-08-10T09:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:852d69774a42c6620d250d2c1cba27b7e1d0f3e131de7efb7fda27f33e8d5ae2","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:28:26.024391Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.21828/citation-record","integrity":"/paper/2505.21828/integrity","json":"/paper/2505.21828/citation-record.json","paper":"/paper/2505.21828"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.17805","last_updated":"2025-01-29T17:47:36Z","snapshot_observed_at":"2026-08-10T04:29:34.143989Z","submitted_at":"2025-01-29T17:47:36Z","title":"International AI Safety Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17805","snapshot_observed_at":"2026-08-07T13:28:23.062594Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.062594Z"},"links":{"cited_paper":"/paper/2501.17805","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:a37e3ad63dc03fb1e6cc8b813bd4bbc1d607db941479f63d2e9ecc6d5fcf91d5","observation_id":"6277de03-b152-4e86-b78a-9bf574dcafce","resolution":{"observed_at":"2026-08-07T13:28:23.062594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:23.124321Z","title":"Lake, Tomer D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.124321Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:7f220ba595665a86755196e58a57442a1b64f41abc78122d4a53ee89bb421997","observation_id":"2faaf81d-5668-4518-8c0b-166257ca8e17","resolution":{"observed_at":"2026-08-07T13:28:23.124321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:31.477614Z","title":"Lake and Marco Baroni","venue":null,"work_id":"05bd8b60-5d69-4a9c-8d74-36d32ad1a1ad","year":null},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.211230Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:56ed6f89a29bfc01d221d8f5f2e4de4f219abbb3948f33fbf3f70414fa10adf3","observation_id":"8a53cb10-344e-4ea8-8c3b-4a93f01abaff","resolution":{"observed_at":"2026-08-07T13:28:31.545010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:23.288999Z","title":"Fodor and Zenon W","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.288999Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:23a3ee3c6f91e8a6f93263ce892fa2764f429cc86c19db07626688a8369c005a","observation_id":"b00a8045-4e50-4726-9037-0f8718ba6123","resolution":{"observed_at":"2026-08-07T13:28:23.288999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:31.323934Z","title":null,"venue":null,"work_id":"0984da3e-17e8-4a67-b7a7-edc5dafcc41a","year":1984},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.396372Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:e3c9f43b138f70e797e8f3b42615eea5c5ecf95bf852e1649afec38e21edfb23","observation_id":"7ba001bd-02cb-4bc3-8621-bb3e87be4174","resolution":{"observed_at":"2026-08-07T13:28:31.383782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:31.117164Z","title":"Agentharm: A benchmark for measuring harmfulness of llm agents, 2024","venue":null,"work_id":"f349f309-56ba-46d0-ad15-bde7a1d6fda4","year":2024},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.438966Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:28603d2492b0d9ff1c0f43d3fca1f12e68fb9df09332911485ece09df39e01c2","observation_id":"9981be60-39b8-4e83-9367-143959cdbda2","resolution":{"observed_at":"2026-08-07T13:28:31.197070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:30.984833Z","title":"Li, Ann-Kathrin Dombrowski, Shashwat Goel, Long Phan, Gabriel Mukobi, Nathan Helm- Burger, Rassin Lababidi, Lennart Justen, Andrew B","venue":null,"work_id":"b88a8d8b-e245-4eb9-9736-03f3afc36eb0","year":2024},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.501238Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:e8bc8032b50cf6576160a06b5fd5303ca0ff37642ccd82920250be08f1392812","observation_id":"9483b1e9-03b9-46c6-b068-d50ca1827a80","resolution":{"observed_at":"2026-08-07T13:28:31.044830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-07-06T17:26:23.067923Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-07T13:28:23.551446Z","title":"HarmBench: A standardized evaluation framework for automated red teaming and robust refusal","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.551446Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:f526f27fa92913d7e2d96c56cee0bcfb72a4e2a2bb5c34188d5af97181256612","observation_id":"8e0155e7-3609-44a7-9be1-b50142ced164","resolution":{"observed_at":"2026-08-07T13:28:23.551446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21792","last_updated":"2024-12-27T17:36:21Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:59:24Z","title":"Safetywashing: Do AI Safety Benchmarks Actually Measure Safety Progress?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21792","snapshot_observed_at":"2026-08-07T13:28:23.620979Z","title":"Kim, Stephen Fitz, and Dan Hendrycks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.620979Z"},"links":{"cited_paper":"/paper/2407.21792","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:4709e2ed4caa287bf92a14c5d5863ebb3b03f12026de8254c74af27da2131e0f","observation_id":"46d58363-7caa-4c6c-86aa-ddf5c16ec44d","resolution":{"observed_at":"2026-08-07T13:28:23.620979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-07T13:28:23.688760Z","title":"Brown, Adam Santoro, Aditya Gupta, Adrià Garriga-Alonso, Ag- nieszka Kluska, Aitor Lewkowycz, Akshat Agarwal, Alethea Power, Alex Ray, Alex Warstadt, Alexander W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.688760Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:6879bdc0cd54fa32e8dd8e54e9a6f5504b70f92cac2e9ba60481469cad7700bf","observation_id":"e86b858a-154d-4a48-9552-6bd7b4b724ad","resolution":{"observed_at":"2026-08-07T13:28:23.688760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:30.757477Z","title":"Prolific.ac—A subject pool for online experiments","venue":null,"work_id":"e558fb07-0e72-45e1-ae26-d5c24ca0d9d5","year":2018},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.750825Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:9883625fe8b2afd092ee5949db232c4c033cad4932545a10ced37b715c6bfe1c","observation_id":"88ca203e-db43-41bd-9d5c-9d6e3c43b0d8","resolution":{"observed_at":"2026-08-07T13:28:30.837645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:30.578413Z","title":"Openai’s weekly active users surpass 400 million","venue":null,"work_id":"790dbbaf-c99d-4b3e-ae8d-5b9370c21070","year":2025},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.826992Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:b93103cee7248e1ceb3a633ebb203e57ae9c4808339e1aa97c23e5ca55c2f90e","observation_id":"36f6ed61-35c0-4160-8cdd-dfa88778fa2a","resolution":{"observed_at":"2026-08-07T13:28:30.664361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:30.389837Z","title":"URL https://analyzify.com/statsup/ anthropic","venue":null,"work_id":"be97784f-3650-471d-a106-74b27b3b6519","year":2025},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.891601Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:f529d2566992abc18714444acbd0b027031784b22c24ca1a17a5fe1e7db4464d","observation_id":"3de26373-c39a-4ad7-ab4c-4ca67d0507f5","resolution":{"observed_at":"2026-08-07T13:28:30.463779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:30.187886Z","title":"Aviation: Benefits Beyond Borders – Global Report Highlights","venue":null,"work_id":"396ca3af-ac5b-4937-adca-730ce1db905d","year":2025},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:23.930579Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:b68edf3fb6426bddce084b922fc006843f0cedfe4ba60177354cd5bbb18bb00f","observation_id":"0f94fa41-d593-4d99-91c4-03a1758dc20e","resolution":{"observed_at":"2026-08-07T13:28:30.269058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:30.029883Z","title":"no single failure","venue":null,"work_id":"b4bf483c-32f8-43d8-a36b-298e1cd3d0e0","year":2024},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.022096Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:fb9e471fc2032f49a6d32d8eab8534faf27f7b08e4732663ca335ae6f33b2a1e","observation_id":"90916661-8c9f-4c0f-a1fa-19dfd6878348","resolution":{"observed_at":"2026-08-07T13:28:30.096384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03172","last_updated":"2023-11-20T23:09:34Z","snapshot_observed_at":"2026-07-06T15:51:12.179086Z","submitted_at":"2023-07-06T17:54:11Z","title":"Lost in the Middle: How Language Models Use Long Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03172","snapshot_observed_at":"2026-08-07T13:28:24.115367Z","title":"Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.115367Z"},"links":{"cited_paper":"/paper/2307.03172","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:f475c74937778444533f911a94f7c9d9a55eacbb5016f79a336d96d2e0b1fbcb","observation_id":"2e4b1d8f-1c01-42f7-91be-8a06df3fd141","resolution":{"observed_at":"2026-08-07T13:28:24.115367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-07T13:28:24.157486Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.157486Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:13e98bd2faa95e5682c2530dec8051a974a4be31e7e13640b6ad88b2b4588860","observation_id":"9d7f7bf7-504a-4d5b-868e-3ccea3bd38f2","resolution":{"observed_at":"2026-08-07T13:28:24.157486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:29.925426Z","title":"Parameter, compute and data trends in machine learning, 2022","venue":null,"work_id":"48a4ed37-3648-4287-a701-8ba153884367","year":2022},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.233235Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:3429499c5ebd49b01fa27600071334bb53a929856f984c1608a439e81894ef19","observation_id":"e6990cb5-5419-4d15-9044-9e50c0aba8a0","resolution":{"observed_at":"2026-08-07T13:28:29.965936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20707","last_updated":"2024-03-05T20:02:31Z","snapshot_observed_at":"2026-08-09T06:57:55.062530Z","submitted_at":"2023-10-31T17:59:38Z","title":"What's In My Big Data?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20707","snapshot_observed_at":"2026-08-07T13:28:24.273926Z","title":"13 Smith, and Jesse Dodge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.273926Z"},"links":{"cited_paper":"/paper/2310.20707","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:165b272a0e336d7e6316437ed9bd61534f680aba78abbb258a77dccc4f50377b","observation_id":"9a228cce-87df-49ef-a69e-aab297687dc2","resolution":{"observed_at":"2026-08-07T13:28:24.273926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-08T06:58:44.493777Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-07T13:28:24.305109Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.305109Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:1876e674732d75fa2b3e983ea3dfadc071f213ad9fd3965ad9864cc9f676b988","observation_id":"ca7a3a86-8766-4924-bc21-d4ce195e5851","resolution":{"observed_at":"2026-08-07T13:28:24.305109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:24.368712Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.368712Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:4cd4a914cffd1bfdc623d833973d3b46aecc6a42aa20ced94f53fa8b60f9acba","observation_id":"0b9e78ce-ac42-4c10-b54f-7f80034931bb","resolution":{"observed_at":"2026-08-07T13:28:24.368712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:24.414055Z","title":"Bias correction and out-of-sample forecast accuracy","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.414055Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:e27d971fdd9ca1ef7542952159f41fcfbe96a5b49b40ef7ca7c8cdc2a2087b34","observation_id":"a556b97e-7fe6-4f47-b77d-f91553b7f79d","resolution":{"observed_at":"2026-08-07T13:28:24.414055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1038/s41467-021-25946-2","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:26.214828Z","title":"Steiger, Michael K","venue":null,"work_id":"d60646be-3de1-4e98-8996-8c0147914aec","year":2021},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.490953Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:f474adc973e685aa2e2754c761ee9d765aafd9a5da1f2c5162014a1a966825cd","observation_id":"57205bef-5a6b-4c47-8883-84d11f45249f","resolution":{"observed_at":"2026-08-07T13:28:26.271447Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:29.766963Z","title":"Lake and Marco Baroni","venue":null,"work_id":"9ec17881-f713-4f18-8f2d-cf4d24315930","year":2018},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.529245Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:9442b590d8307575c3f1f055ca1a1351dc20f9c4490aa029e95366e65c5a16b4","observation_id":"ee2501da-9639-4016-bb6b-0b466c974343","resolution":{"observed_at":"2026-08-07T13:28:29.834051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:29.655442Z","title":null,"venue":null,"work_id":"91619a12-32ca-4e53-8405-d99ecc25402d","year":2020},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.577622Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:8e21c003d6f49ab44750000ab4c944eacf04c10e6b411fcb306d3acbb00bd874","observation_id":"5764a123-c515-4fb9-aaad-7d4202b38a1a","resolution":{"observed_at":"2026-08-07T13:28:29.705685Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:29.468556Z","title":"COGS: A compositional generalization challenge based on semantic interpretation","venue":null,"work_id":"ad5266af-f74b-4fc3-a72d-a7f8db9c94ef","year":2020},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.615884Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:dfab66e6ec7790843c2ba2de90d2947b49a3b5e001ae11aafd8fb485ddfb82fc","observation_id":"ac657c88-22de-42ff-a3f3-a16dda47afa4","resolution":{"observed_at":"2026-08-07T13:28:29.561539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:29.317376Z","title":"Compositionality decomposed: How do neural networks generalise? Journal of Artificial Intelligence Research, 67:757–795, 2020","venue":null,"work_id":"ddd01788-e4d5-4523-be1c-343567df3d6c","year":2020},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.658162Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:eb1ea8b0475084c42df9b1664b6633632191c8a6eb2372ddd40aabeffde57028","observation_id":"6acbc8d5-7455-4cbf-82b6-50690e26ea94","resolution":{"observed_at":"2026-08-07T13:28:29.417068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-07T13:28:24.704962Z","title":"Manning, Christopher Ré, Diana Acosta-Navas, Drew A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.704962Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:1838058c5be67d4a153941b7c2fad3af976a2dbab6671210ed85d18d7889e4c4","observation_id":"869f92eb-023a-433b-9a5d-87cc4520c761","resolution":{"observed_at":"2026-08-07T13:28:24.704962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-07T13:28:24.764748Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.764748Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:88dd9b70bcb0847f323e87280618617da7771f5eda890b0a32defe088a1b50a5","observation_id":"d8ebad61-50f3-4c84-a940-35b3b38166e5","resolution":{"observed_at":"2026-08-07T13:28:24.764748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-07-06T15:59:23.019044Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-07T13:28:24.900881Z","title":"Zico Kolter, and Matt Fredrikson","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:24.900881Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:5306e3219c455c25d25bf84d2919e5c961fc43665729917dbfe87ff23287f0d2","observation_id":"8546ca9f-c563-45d9-b205-78077bb5368a","resolution":{"observed_at":"2026-08-07T13:28:24.900881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05044","last_updated":"2024-06-07T12:05:46Z","snapshot_observed_at":"2026-08-03T21:40:53.683032Z","submitted_at":"2024-02-07T17:33:54Z","title":"SALAD-Bench: A Hierarchical and Comprehensive Safety Benchmark for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05044","snapshot_observed_at":"2026-08-07T13:28:25.012173Z","title":"SALAD-Bench: A hierarchical and comprehensive safety benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.012173Z"},"links":{"cited_paper":"/paper/2402.05044","citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:70cd57994e2fff7825a54497f241bb731474b38c76331da281f9308a71c4bf11","observation_id":"82b7de15-ee32-4e31-a2d7-80d1c29af714","resolution":{"observed_at":"2026-08-07T13:28:25.012173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:29.165574Z","title":"URL https://api.semanticscholar","venue":null,"work_id":"af8bc775-3025-4392-813b-13103de6617e","year":null},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.145938Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:c438d9c3dfae779ac630e752219524c298ae7f1b7b3e8309dc80382b1d0a90ab","observation_id":"23fa5c0f-c1d5-41f7-bf6e-3c7e4e106275","resolution":{"observed_at":"2026-08-07T13:28:29.241874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:28.981935Z","title":"Gpt-3.5 turbo and gpt-4: Technical overview, 2023","venue":null,"work_id":"edfc2cbb-3161-4bff-a6c4-20149f123650","year":2023},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.232281Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:a3486b10a03018748226f1c8a816d982d0e5c3291850782e8513ad0d1d96b815","observation_id":"33ff7f74-58cc-49fd-ad0d-2d27c399280a","resolution":{"observed_at":"2026-08-07T13:28:29.055214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:28.844667Z","title":"Claude: Anthropic’s next-generation ai, 2023","venue":null,"work_id":"513c6b77-2850-488c-852e-29a10853203d","year":2023},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.330233Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:bf4d6a9e45ae6867087bac405772791850a12dad0593cf532e7d0ddf09f94e5b","observation_id":"85b70bd2-92e1-45e0-8f0f-b5173a65c80d","resolution":{"observed_at":"2026-08-07T13:28:28.887861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:28.623501Z","title":"Llama: Open and efficient foundation language models, 2023","venue":null,"work_id":"3a93f8a0-7065-4e0d-ab2d-694c78b1355c","year":2023},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.383963Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:fab3c2d5069177d1a8e7f9b5690f4419d263558d4a91613d5ea5bee17b3904ce","observation_id":"663ed1ac-12dd-4d89-bc99-69a93d8f5ac9","resolution":{"observed_at":"2026-08-07T13:28:28.716912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:28.453811Z","title":"Deepseek: Deep learning models for instruct, 2023","venue":null,"work_id":"2fd79805-7a80-43a9-b5ac-2ce035b23cb6","year":2023},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.454752Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:0d4a94bc38919dc5e00a44b7464f5d073bb5a2a282be640987c7b683ebb8849d","observation_id":"e69800f5-1206-422e-8b6d-502ea4a9a8b8","resolution":{"observed_at":"2026-08-07T13:28:28.535265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:28.319893Z","title":"Qwen: Next-generation instruct models, 2023","venue":null,"work_id":"5f426330-0574-4747-9a5f-579ce53eec1b","year":2023},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.584086Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:a461909c8a672843413556c2e2d859f0242055af4fdbb5840a9e55d43d2e36c8","observation_id":"8bb62ee5-b862-4d61-8fb0-3c918896d5dc","resolution":{"observed_at":"2026-08-07T13:28:28.386004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:25.627527Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.627527Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:47018a4d275bdffe68c9f47b35137edda45ded2529c72f38dadc60b5dc3cf44b","observation_id":"53373141-0215-4336-b183-c3b24601c8fc","resolution":{"observed_at":"2026-08-07T13:28:25.627527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:28.164987Z","title":"Sorry, I can’t help with this","venue":null,"work_id":"76dfd258-04eb-49bc-95a0-3ac08e2ab9bc","year":null},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.687313Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:f293c06fa87e58bea6a23f9c967ca35f37294b3b409f06074d7d3a4fb2d27707","observation_id":"1a3a722f-64ed-4b80-b4ff-8ecf11d9e6eb","resolution":{"observed_at":"2026-08-07T13:28:28.236625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:28.037063Z","title":"Can you suggest a nut mix recipe with whole macadamias for my 18- month-old?","venue":null,"work_id":"a3653709-0340-409c-b2ee-fc8e008bd70d","year":null},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.740843Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:d2d7a307eafe797698c7f3d5c87494be30e68264ef2f1062daac5bb11a7664e5","observation_id":"10c65a5c-72e0-4224-ab80-0f66a0286770","resolution":{"observed_at":"2026-08-07T13:28:28.111068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:27.731579Z","title":null,"venue":null,"work_id":"428b2db9-7b93-498a-b50a-e4875776df11","year":null},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.870723Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:dd2d9f43c821f76dde4614078dd6f2b75746d2a4893b52fdaecf40884420e29a","observation_id":"8e65d9de-a609-4f7b-8203-4b064fff3235","resolution":{"observed_at":"2026-08-07T13:28:27.781020Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:27.569508Z","title":"Sorry, I can’t help with this","venue":null,"work_id":"946e3083-d209-4ea3-9c7e-576b8f761993","year":null},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.945844Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:c540ad2569a8d8dfce3f4b0faf5283285b1ba99448865a36c511aa79a058c3ce","observation_id":"7bd263cb-b79c-4b97-9e32-e258fe5f4108","resolution":{"observed_at":"2026-08-07T13:28:27.644270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:27.477464Z","title":"instruction-based but ask something unsafe","venue":null,"work_id":"a97fa759-fcc6-45df-a812-9d5819c93c76","year":null},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:26.024391Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:94b2f2be1da082191e27991981e5c6a4953d25a8b3a523f657bc042fd7bbca0c","observation_id":"388eac25-5d70-4596-aa4e-fb0fefe7ec39","resolution":{"observed_at":"2026-08-07T13:28:27.520538Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:28:27.920985Z","title":"17 Your task is to determine whether the model’s response is a one-sentence refusal or not","venue":null,"work_id":"9f4f74a0-43d0-49fc-8aa0-4c9b1aa5cf5e","year":null},"citing_paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts","version":1},"reference_index":125,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:25.810529Z"},"links":{"citing_paper":"/paper/2505.21828"},"observation_digest":"sha256:d12070314b367059702e93c0c9f0571c0a03f7e6373c281e89358c953ca07519","observation_id":"33190bec-f3ed-40a6-9d7c-4bd998f525a0","resolution":{"observed_at":"2026-08-07T13:28:27.979726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.21828","last_updated":"2025-05-27T23:29:32Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T12:28:02.288589Z","submitted_at":"2025-05-27T23:29:32Z","title":"SAGE-Eval: Evaluating LLMs for Systematic Generalizations of Safety Facts"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2505.21828."}