{"as_of":"2026-08-14T21:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:474da5c36b459ed155d4f0c852b2a7757b9fa8d4bfed16319cf69b8d5951c07a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:43:31.508571Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T06:11:49.618920Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.17306","last_updated":"2023-05-26T23:46:42Z","snapshot_observed_at":"2026-08-13T11:32:00.628056Z","submitted_at":"2023-05-26T23:46:42Z","title":"Chain-of-Thought Hub: A Continuous Effort to Measure Large Language Models' Reasoning Performance","version":1},"cited_work":{"arxiv_id":"2305.17306","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.17306","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2305.17306 , year=","venue":null,"work_id":"bbda8612-8e45-46f9-96ea-1000603eaf6f","year":2023},"citing_paper":{"arxiv_id":"2309.08532","last_updated":"2025-05-01T11:56:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-15T16:50:09Z","title":"EvoPrompt: Connecting LLMs with Evolutionary Algorithms Yields Powerful Prompt Optimizers","version":3},"reference_index":175,"source":"arxiv_source","source_observed_at":"2026-05-16T06:11:49.475825Z"},"links":{"cited_paper":"/paper/2305.17306","citing_paper":"/paper/2309.08532"},"observation_digest":"sha256:006f8fdfedb1b7a9cf24613663f8549f80c2d53090bb1c55a52d9be781e57ca0","observation_id":"3125a8e7-5f85-4aa4-b5f0-12d96b09c913","resolution":{"observed_at":"2026-05-16T06:11:49.620612Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17306","last_updated":"2023-05-26T23:46:42Z","snapshot_observed_at":"2026-08-13T11:32:00.628056Z","submitted_at":"2023-05-26T23:46:42Z","title":"Chain-of-Thought Hub: A Continuous Effort to Measure Large Language Models' Reasoning Performance","version":1},"cited_work":{"arxiv_id":"2305.17306","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.17306","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2305.17306 , year=","venue":null,"work_id":"bbda8612-8e45-46f9-96ea-1000603eaf6f","year":2023},"citing_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T15:51:04.674346Z"},"links":{"cited_paper":"/paper/2305.17306","citing_paper":"/paper/2406.01574"},"observation_digest":"sha256:c41230577e3ae8e668141377763869005e76bb0fd1b7fe875801789a10b5bde1","observation_id":"fc57fbf5-dd0d-4f2f-b7e5-f2439d25b8ec","resolution":{"observed_at":"2026-05-11T15:51:06.479417Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17306","last_updated":"2023-05-26T23:46:42Z","snapshot_observed_at":"2026-08-13T11:32:00.628056Z","submitted_at":"2023-05-26T23:46:42Z","title":"Chain-of-Thought Hub: A Continuous Effort to Measure Large Language Models' Reasoning Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17306","snapshot_observed_at":"2026-08-12T05:43:31.508571Z","title":"Chain-of-thought hub: A continuous effort to measure large language models’ reasoning performance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19943","last_updated":"2025-01-13T06:53:56Z","snapshot_observed_at":"2026-08-12T05:37:08.249486Z","submitted_at":"2024-11-29T18:58:22Z","title":"Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T05:43:31.508571Z"},"links":{"cited_paper":"/paper/2305.17306","citing_paper":"/paper/2411.19943"},"observation_digest":"sha256:a9084fb6c16940bee8636f3f8a203b8c260fc20107178aa29db200c861c213e8","observation_id":"7af01e0a-c023-4038-90e9-ac3e09839277","resolution":{"observed_at":"2026-08-12T05:43:31.508571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17306","last_updated":"2023-05-26T23:46:42Z","snapshot_observed_at":"2026-08-13T11:32:00.628056Z","submitted_at":"2023-05-26T23:46:42Z","title":"Chain-of-Thought Hub: A Continuous Effort to Measure Large Language Models' Reasoning Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17306","snapshot_observed_at":"2026-08-09T10:29:05.102114Z","title":"Chain-of-thought hub: A continuous effort to measure large language models' reasoning performance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07803","last_updated":"2025-02-05T08:23:18Z","snapshot_observed_at":"2026-08-10T13:33:55.349893Z","submitted_at":"2025-02-05T08:23:18Z","title":"Reasoning-as-Logic-Units: Scaling Test-Time Reasoning in Large Language Models Through Logic Unit Alignment","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T10:29:05.102114Z"},"links":{"cited_paper":"/paper/2305.17306","citing_paper":"/paper/2502.07803"},"observation_digest":"sha256:0bbaa41f70cf6537b0234068fc5799db475b9a1c5befc11630fd8737e54ed7f3","observation_id":"08957de5-5eaf-4ba8-a095-25b1d9cd9fc6","resolution":{"observed_at":"2026-08-09T10:29:05.102114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17306","last_updated":"2023-05-26T23:46:42Z","snapshot_observed_at":"2026-08-13T11:32:00.628056Z","submitted_at":"2023-05-26T23:46:42Z","title":"Chain-of-Thought Hub: A Continuous Effort to Measure Large Language Models' Reasoning Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17306","snapshot_observed_at":"2026-08-07T14:16:38.906618Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19578","last_updated":"2025-05-26T06:48:53Z","snapshot_observed_at":"2026-08-12T00:59:42.531142Z","submitted_at":"2025-05-26T06:48:53Z","title":"Accelerating Prefilling for Long-Context LLMs via Sparse Pattern Sharing","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:16:38.906618Z"},"links":{"cited_paper":"/paper/2305.17306","citing_paper":"/paper/2505.19578"},"observation_digest":"sha256:6bb7181096b0437f554634924228c95a50076d3c939826cc393233df4cea3779","observation_id":"3dc423ee-3c08-4c77-8182-bfee253b9632","resolution":{"observed_at":"2026-08-07T14:16:38.906618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17306","last_updated":"2023-05-26T23:46:42Z","snapshot_observed_at":"2026-08-13T11:32:00.628056Z","submitted_at":"2023-05-26T23:46:42Z","title":"Chain-of-Thought Hub: A Continuous Effort to Measure Large Language Models' Reasoning Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17306","snapshot_observed_at":"2026-08-07T00:59:56.011837Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12301","last_updated":"2025-06-14T01:30:17Z","snapshot_observed_at":"2026-08-12T07:32:16.943974Z","submitted_at":"2025-06-14T01:30:17Z","title":"Unveiling Confirmation Bias in Chain-of-Thought Reasoning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T00:59:56.011837Z"},"links":{"cited_paper":"/paper/2305.17306","citing_paper":"/paper/2506.12301"},"observation_digest":"sha256:909e839162397fa871563cf3bfc831b2c2955aae86c0630c9cb40d64ed6ecbab","observation_id":"ca86b9f3-67f7-4281-9408-c936f7603346","resolution":{"observed_at":"2026-08-07T00:59:56.011837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17306","last_updated":"2023-05-26T23:46:42Z","snapshot_observed_at":"2026-08-13T11:32:00.628056Z","submitted_at":"2023-05-26T23:46:42Z","title":"Chain-of-Thought Hub: A Continuous Effort to Measure Large Language Models' Reasoning Performance","version":1},"cited_work":{"arxiv_id":"2305.17306","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.17306","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2305.17306 , year=","venue":null,"work_id":"bbda8612-8e45-46f9-96ea-1000603eaf6f","year":2023},"citing_paper":{"arxiv_id":"2605.08486","last_updated":"2026-05-08T21:03:25Z","snapshot_observed_at":"2026-08-13T17:30:30.053997Z","submitted_at":"2026-05-08T21:03:25Z","title":"Teachers' Perceived Benefits and Risks of AI Across Fifty-Five Countries: An Audit of LLM Alignment and Steerability","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T01:23:47.674864Z"},"links":{"cited_paper":"/paper/2305.17306","citing_paper":"/paper/2605.08486"},"observation_digest":"sha256:9afb146ea9f5b0b9b6be3571efa3a5df4dadd786930ca34eacef76db3dc330b9","observation_id":"0733760a-766f-4f50-879a-0ecc5fcf7849","resolution":{"observed_at":"2026-05-12T08:01:29.062547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17306","last_updated":"2023-05-26T23:46:42Z","snapshot_observed_at":"2026-08-13T11:32:00.628056Z","submitted_at":"2023-05-26T23:46:42Z","title":"Chain-of-Thought Hub: A Continuous Effort to Measure Large Language Models' Reasoning Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17306","snapshot_observed_at":"2026-08-02T14:39:31.125273Z","title":"arXiv preprint arXiv:2305.17306 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20427","last_updated":"2026-05-08T16:55:49Z","snapshot_observed_at":"2026-08-14T16:22:44.988939Z","submitted_at":"2026-05-08T16:55:49Z","title":"Is MoE Routing a Huffman Code? Discovering the Frequency-Diversity Law in Chain-of-Thought","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T14:39:31.125273Z"},"links":{"cited_paper":"/paper/2305.17306","citing_paper":"/paper/2607.20427"},"observation_digest":"sha256:255a715dce3eed49c2c9cd559ebe87db50bf5999583acd1f11be5847b16f70e2","observation_id":"de414963-30fd-4442-a43e-5a16d83233d4","resolution":{"observed_at":"2026-08-02T14:39:31.125273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17306","last_updated":"2023-05-26T23:46:42Z","snapshot_observed_at":"2026-08-13T11:32:00.628056Z","submitted_at":"2023-05-26T23:46:42Z","title":"Chain-of-Thought Hub: A Continuous Effort to Measure Large Language Models' Reasoning Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17306","snapshot_observed_at":"2026-08-01T03:38:23.547518Z","title":"Chain-of-thought hub: A continuous effort to measure large language models’ reasoning performance.CoRR, abs/2305.17306, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23124","last_updated":"2026-07-25T09:58:24Z","snapshot_observed_at":"2026-08-13T05:20:19.560532Z","submitted_at":"2026-07-25T09:58:24Z","title":"AgentOmnia: Scaling Agentic Models for Full-Scenario Applications","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-01T03:38:23.547518Z"},"links":{"cited_paper":"/paper/2305.17306","citing_paper":"/paper/2607.23124"},"observation_digest":"sha256:1e19a187e95ef41239a11013793996a08e9d6d93f0073ab21b3da74b38930beb","observation_id":"ed1aab7e-681f-4ae5-a243-7c29b2de7278","resolution":{"observed_at":"2026-08-01T03:38:23.547518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.17306/citation-record","integrity":"/paper/2305.17306/integrity","json":"/paper/2305.17306/citation-record.json","paper":"/paper/2305.17306"},"outbound":[],"paper":{"arxiv_id":"2305.17306","last_updated":"2023-05-26T23:46:42Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T11:32:00.628056Z","submitted_at":"2023-05-26T23:46:42Z","title":"Chain-of-Thought Hub: A Continuous Effort to Measure Large Language Models' Reasoning Performance"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2305.17306."}