{"as_of":"2026-08-06T19:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b6d2fc635dfb07c8fd1d96a8efe8077d956a5f406b9ac4208c78ebc338a6db7","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T23:43:07.803719Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T06:09:46.933171Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T14:28:31.386601Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures","version":2},"cited_work":{"arxiv_id":"2602.12966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.12966","snapshot_observed_at":"2026-07-03T14:28:31.386601Z","title":"Probellm: Automating principled diagnosis of llm failures","venue":"cs.CL","work_id":"d3b4c8ae-432e-4d96-911a-c72cb7fa211f","year":2026},"citing_paper":{"arxiv_id":"2604.07655","last_updated":"2026-04-08T23:47:29Z","snapshot_observed_at":"2026-08-02T09:41:13.361711Z","submitted_at":"2026-04-08T23:47:29Z","title":"Guardian-as-an-Advisor: Advancing Next-Generation Guardian Models for Trustworthy LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T17:27:13.339411Z"},"links":{"cited_paper":"/paper/2602.12966","citing_paper":"/paper/2604.07655"},"observation_digest":"sha256:e35120c135fb0c5a2fbb84275d93c0500c8354dffd1a2f66afa307f60f3e5c4c","observation_id":"72ccd56b-2c5d-483f-84e1-aabe6c4cb8b2","resolution":{"observed_at":"2026-06-10T02:11:49.648006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures","version":2},"cited_work":{"arxiv_id":"2602.12966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.12966","snapshot_observed_at":"2026-07-03T14:28:31.386601Z","title":"Probellm: Automating principled diagnosis of llm failures","venue":"cs.CL","work_id":"d3b4c8ae-432e-4d96-911a-c72cb7fa211f","year":2026},"citing_paper":{"arxiv_id":"2605.05678","last_updated":"2026-05-07T05:12:56Z","snapshot_observed_at":"2026-08-02T07:12:00.817422Z","submitted_at":"2026-05-07T05:12:56Z","title":"Chain of Risk: Safety Failures in Large Reasoning Models and Mitigation via Adaptive Multi-Principle Steering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-08T11:49:47.994456Z"},"links":{"cited_paper":"/paper/2602.12966","citing_paper":"/paper/2605.05678"},"observation_digest":"sha256:da96a6ad6790e3864bf4cba355a3fed1edfbac8b6805a1254f795caafb2d2df7","observation_id":"1e1b4f2a-747c-4ddf-9282-4b6491c86229","resolution":{"observed_at":"2026-06-10T02:11:49.648006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures","version":2},"cited_work":{"arxiv_id":"2602.12966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.12966","snapshot_observed_at":"2026-07-03T14:28:31.386601Z","title":"Probellm: Automating principled diagnosis of llm failures","venue":"cs.CL","work_id":"d3b4c8ae-432e-4d96-911a-c72cb7fa211f","year":2026},"citing_paper":{"arxiv_id":"2606.09878","last_updated":"2026-06-03T01:28:00Z","snapshot_observed_at":"2026-07-06T23:49:08.412079Z","submitted_at":"2026-06-03T01:28:00Z","title":"FailureScope: Cross-Regime Behavioral Diagnosis of Language Model Weaknesses","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T07:16:30.725358Z"},"links":{"cited_paper":"/paper/2602.12966","citing_paper":"/paper/2606.09878"},"observation_digest":"sha256:5cdfab44ba290a234065cc5d8bf0aab836fa1af62579e175883ec682f9d073b0","observation_id":"835d23ac-818a-45cb-b47f-0dbb2c9695c1","resolution":{"observed_at":"2026-07-02T06:56:44.731661Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures","version":2},"cited_work":{"arxiv_id":"2602.12966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.12966","snapshot_observed_at":"2026-07-03T14:28:31.386601Z","title":"Probellm: Automating principled diagnosis of llm failures","venue":"cs.CL","work_id":"d3b4c8ae-432e-4d96-911a-c72cb7fa211f","year":2026},"citing_paper":{"arxiv_id":"2606.13174","last_updated":"2026-06-11T10:43:40Z","snapshot_observed_at":"2026-08-06T01:22:05.098509Z","submitted_at":"2026-06-11T10:43:40Z","title":"Getting Better at Working With You: Compiling User Corrections into Runtime Enforcement for Coding Agents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-27T07:04:51.970049Z"},"links":{"cited_paper":"/paper/2602.12966","citing_paper":"/paper/2606.13174"},"observation_digest":"sha256:c5ed2ba3135c004817005dbd7fd6762f399389871375f7a476506182dfd47b03","observation_id":"1b007848-5601-4196-97d2-e454efe05a34","resolution":{"observed_at":"2026-07-03T14:28:31.387876Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12966","snapshot_observed_at":"2026-07-14T06:09:46.933171Z","title":"ProbeLLM: Automating principled diagnosis of LLM failures,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11228","last_updated":"2026-07-13T08:19:09Z","snapshot_observed_at":"2026-08-02T17:44:08.904769Z","submitted_at":"2026-07-13T08:19:09Z","title":"DeepBias: Adaptive In-depth Probing of Social Biases in LVLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T06:09:46.933171Z"},"links":{"cited_paper":"/paper/2602.12966","citing_paper":"/paper/2607.11228"},"observation_digest":"sha256:490f4fd0118e21c8f9bcb55ab4374334197b0261792e63d1187543c43f4b1731","observation_id":"d69426c1-14cb-4eb9-bfc8-27e268cffb13","resolution":{"observed_at":"2026-07-14T06:09:46.933171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.12966","snapshot_observed_at":"2026-07-14T02:33:34.084111Z","title":"Probellm: Automating principled diagnosis of llm failures, 2026 b","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11871","last_updated":"2026-07-13T17:55:19Z","snapshot_observed_at":"2026-08-05T16:49:44.432361Z","submitted_at":"2026-07-13T17:55:19Z","title":"Inside the Unfair Judge: A Mechanistic Interpretability Account of LLM-as-Judge Bias","version":1},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-07-14T02:33:34.084111Z"},"links":{"cited_paper":"/paper/2602.12966","citing_paper":"/paper/2607.11871"},"observation_digest":"sha256:f14e6a09093bbf25c1780fe9595effbd5e686eb0350e982e7111f63d63e34bdb","observation_id":"5d4d1f21-7196-433c-a1f7-36cb705dc80b","resolution":{"observed_at":"2026-07-14T02:33:34.084111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.12966/citation-record","integrity":"/paper/2602.12966/integrity","json":"/paper/2602.12966/citation-record.json","paper":"/paper/2602.12966"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:43:06.888055Z","title":"URL https: //aclanthology.org/2025.acl-long.17/","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:06.888055Z"},"links":{"citing_paper":"/paper/2602.12966"},"observation_digest":"sha256:a1c3a18dfac49f9fa08365a64640d2815141105e9caf8065f629fc4f5884c19a","observation_id":"d7db0cbe-6faa-4159-83b1-d5822ad74e8d","resolution":{"observed_at":"2026-08-02T23:43:06.888055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07468","last_updated":"2026-07-06T07:31:35Z","snapshot_observed_at":"2026-07-09T23:18:04.916101Z","submitted_at":"2025-06-09T06:35:12Z","title":"Chasing Moving Targets with Online Self-Play Reinforcement Learning for Safer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07468","snapshot_observed_at":"2026-08-02T23:43:07.037472Z","title":"org/CorpusID:237532606","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:07.037472Z"},"links":{"cited_paper":"/paper/2506.07468","citing_paper":"/paper/2602.12966"},"observation_digest":"sha256:ebe012da5af9fa0c05a73a7e6a84dc5da2c88856d0709a60eb7e4f2709b62108","observation_id":"5cf49950-f877-4f14-98ac-021460384fb4","resolution":{"observed_at":"2026-08-02T23:43:07.037472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-02T23:43:07.177211Z","title":"12 PROBELLM: Automating Principled Diagnosis of LLM Failures OpenAI","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:07.177211Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2602.12966"},"observation_digest":"sha256:590df5ff82032145ab535c9840cf63651ef5cceaa6499d2ded1533ec69d35bc0","observation_id":"02beb234-b5d3-47f7-bdcd-86b5ceee21f2","resolution":{"observed_at":"2026-08-02T23:43:07.177211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T23:43:07.294716Z","title":"org/CorpusID:218551201","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:07.294716Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2602.12966"},"observation_digest":"sha256:09f43aa042029c98f6a09886ebe512ce54d279e4816e8c8e816322d2bf1967a3","observation_id":"62c7fc2c-a713-4d3c-9f1f-d8ae70d65ebf","resolution":{"observed_at":"2026-08-02T23:43:07.294716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23361","last_updated":"2025-03-30T08:33:56Z","snapshot_observed_at":"2026-08-05T11:57:30.704832Z","submitted_at":"2025-03-30T08:33:56Z","title":"Discovering Knowledge Deficiencies of Language Models on Massive Knowledge Base","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23361","snapshot_observed_at":"2026-08-02T23:43:07.464377Z","title":"org/CorpusID:267412607","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:07.464377Z"},"links":{"cited_paper":"/paper/2503.23361","citing_paper":"/paper/2602.12966"},"observation_digest":"sha256:4b5fdbf9f4946dfec44339ad57fd303f5fb3b0871c0bcc5e5938424249e5cc05","observation_id":"9b38479a-5fe6-48ff-b489-5aa0bc94c903","resolution":{"observed_at":"2026-08-02T23:43:07.464377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07394","last_updated":"2024-06-13T07:19:06Z","snapshot_observed_at":"2026-07-06T18:29:00.001236Z","submitted_at":"2024-06-11T16:01:07Z","title":"Accessing GPT-4 level Mathematical Olympiad Solutions via Monte Carlo Tree Self-refine with LLaMa-3 8B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07394","snapshot_observed_at":"2026-08-02T23:43:07.803719Z","title":"reversal curse,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:07.803719Z"},"links":{"cited_paper":"/paper/2406.07394","citing_paper":"/paper/2602.12966"},"observation_digest":"sha256:f4e7205cb172c0ab4bd46b3a525d0b9c558fa366479f1c2dbdceb62395a271dc","observation_id":"7e203e4a-8339-481e-8f50-b0f2ab11aa5e","resolution":{"observed_at":"2026-08-02T23:43:07.803719Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:43:06.773853Z","title":"org/CorpusID:15184765","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures","version":2},"reference_index":2006,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:06.773853Z"},"links":{"citing_paper":"/paper/2602.12966"},"observation_digest":"sha256:bfb5e34e25b67d1cb9d39b24cbb92f2ff44a3a1454cef62493ea32a964263ca6","observation_id":"a2578719-f5dc-470c-9026-44b8627cdff5","resolution":{"observed_at":"2026-08-02T23:43:06.773853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15585","last_updated":"2025-06-09T02:36:20Z","snapshot_observed_at":"2026-07-06T21:12:51.325430Z","submitted_at":"2025-04-22T05:02:49Z","title":"A Comprehensive Survey in LLM(-Agent) Full Stack Safety: Data, Training and Deployment","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15585","snapshot_observed_at":"2026-08-02T23:43:07.687190Z","title":"org/CorpusID:143424870","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:07.687190Z"},"links":{"cited_paper":"/paper/2504.15585","citing_paper":"/paper/2602.12966"},"observation_digest":"sha256:e2fdb92ae4c5e29ccf8623b7931f738d9c644472a87be4b03504f7a1036bf127","observation_id":"746a367d-6d75-4b97-850f-e419c3b57eb1","resolution":{"observed_at":"2026-08-02T23:43:07.687190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05038","last_updated":"2026-04-24T07:38:08Z","snapshot_observed_at":"2026-07-17T08:06:26.653572Z","submitted_at":"2025-06-05T13:42:39Z","title":"Toward Automated Robustness Evaluation of Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05038","snapshot_observed_at":"2026-08-02T23:43:06.664084Z","title":"org/CorpusID:221516475","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:06.664084Z"},"links":{"cited_paper":"/paper/2506.05038","citing_paper":"/paper/2602.12966"},"observation_digest":"sha256:d9b4956e0b4d8eabf0300c92518c5612e8fa9a7d30d182a012af21505ca46b60","observation_id":"35f6cc96-e0d7-4b2e-b2c7-488aac151725","resolution":{"observed_at":"2026-08-02T23:43:06.664084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10559","last_updated":"2025-04-14T14:53:56Z","snapshot_observed_at":"2026-07-06T21:09:17.062196Z","submitted_at":"2025-04-14T14:53:56Z","title":"Efficient Process Reward Model Training via Active Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10559","snapshot_observed_at":"2026-08-02T23:43:06.529225Z","title":"org/CorpusID:235727396","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:06.529225Z"},"links":{"cited_paper":"/paper/2504.10559","citing_paper":"/paper/2602.12966"},"observation_digest":"sha256:0a8e45f83a9b31f10293ff5b17cf4c80dbcf88c74e93303d962f4bffc4f55127","observation_id":"d7328d18-8700-4e10-9f7c-525745f77d99","resolution":{"observed_at":"2026-08-02T23:43:06.529225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-02T23:43:06.429401Z","title":"a is b” fail to learn “b is a","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:06.429401Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2602.12966"},"observation_digest":"sha256:9d87baaf4ab1eec70a6d6c880d154b1c38354881bfebc5bc3b60d621629637d4","observation_id":"af7a3fd0-9c46-43f7-bb56-7917466a3894","resolution":{"observed_at":"2026-08-02T23:43:06.429401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:43:07.587407Z","title":"org/CorpusID:277452302","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T23:43:07.587407Z"},"links":{"citing_paper":"/paper/2602.12966"},"observation_digest":"sha256:7f339ce3c9fccf1433e7beeeb4240ae8834b2efc3cc1c5afd877d64ad4b0490c","observation_id":"cfca5e10-3479-4c8a-821a-b05cb32972c2","resolution":{"observed_at":"2026-08-02T23:43:07.587407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.12966","last_updated":"2026-06-09T04:02:52Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T23:42:58.142462Z","submitted_at":"2026-02-13T14:33:13Z","title":"ProbeLLM: Automating Principled Diagnosis of LLM Failures"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 6 inbound Pith citation observations for arXiv:2602.12966."}