{"as_of":"2026-08-10T20:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1270dc5f1857ec2390d895d0f892488eb67f87d67361923b43182f6ef16909b9","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T17:36:09.728402Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.00855/citation-record","integrity":"/paper/2502.00855/integrity","json":"/paper/2502.00855/citation-record.json","paper":"/paper/2502.00855"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06435","snapshot_observed_at":"2026-08-09T17:36:09.570661Z","title":"A comprehensive overview of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.570661Z"},"links":{"cited_paper":"/paper/2307.06435","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:a26c1222a61aff7246ad2849282511abd3d0c126a98839bf5188bd90272faab9","observation_id":"46adc04e-6384-4ba7-8012-b5d099c8852a","resolution":{"observed_at":"2026-08-09T17:36:09.570661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-09T17:36:09.575829Z","title":"A survey of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.575829Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:2b582667a0e1a650db89ed7e4eb5e684d78eda79b25043545347aad3c591b153","observation_id":"d09e761d-77e3-4767-b373-dd821fc42455","resolution":{"observed_at":"2026-08-09T17:36:09.575829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16075","last_updated":"2024-12-20T17:19:24Z","snapshot_observed_at":"2026-08-10T16:31:30.588988Z","submitted_at":"2024-12-20T17:19:24Z","title":"Formal Mathematical Reasoning: A New Frontier in AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16075","snapshot_observed_at":"2026-08-09T17:36:09.579223Z","title":"Formal mathematical reasoning: A new frontier in ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.579223Z"},"links":{"cited_paper":"/paper/2412.16075","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:98de38a8bbd33bc46c3b4485d831b0e0b32ed704b9be34c79fd53e2369714790","observation_id":"196b91ae-25b8-4233-9d40-4719144d5489","resolution":{"observed_at":"2026-08-09T17:36:09.579223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00157","last_updated":"2024-09-16T19:20:59Z","snapshot_observed_at":"2026-08-10T10:27:46.046930Z","submitted_at":"2024-01-31T20:26:32Z","title":"Large Language Models for Mathematical Reasoning: Progresses and Challenges","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00157","snapshot_observed_at":"2026-08-09T17:36:09.582966Z","title":"Large language models for mathematical reasoning: Progresses and challenges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.582966Z"},"links":{"cited_paper":"/paper/2402.00157","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:dcf5bd8287263efa49ba39e05f0b77cf010f30cd6c44fc8d985f64466a5d59a7","observation_id":"a792a89c-122f-401b-ac54-8d560c2bc5bc","resolution":{"observed_at":"2026-08-09T17:36:09.582966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:10.335034Z","title":null,"venue":null,"work_id":"85ff9549-286b-43f2-9d1b-c3fcb8e96525","year":2024},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.586909Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:7c24ccacdda2b9107865f6c134479b87367dc10b5717ac5f44dae275a5898066","observation_id":"216c546e-e74a-47a8-ad92-f6e0602a77da","resolution":{"observed_at":"2026-08-09T17:36:10.338408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00656","last_updated":"2023-10-27T12:44:32Z","snapshot_observed_at":"2026-08-07T23:33:42.816316Z","submitted_at":"2023-10-01T12:47:59Z","title":"LEGO-Prover: Neural Theorem Proving with Growing Libraries","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00656","snapshot_observed_at":"2026-08-09T17:36:09.590116Z","title":"Lego-prover: Neural theorem proving with growing libraries","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.590116Z"},"links":{"cited_paper":"/paper/2310.00656","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:f4392a26baff5f7f273bd319c3b67b753a7adc8f80886180e3141d20aa83c24a","observation_id":"724b3397-60c7-492f-8a31-f7ab8e55b027","resolution":{"observed_at":"2026-08-09T17:36:09.590116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05692","last_updated":"2025-01-14T05:39:40Z","snapshot_observed_at":"2026-07-06T17:57:19.117933Z","submitted_at":"2024-04-08T17:18:04Z","title":"Evaluating Mathematical Reasoning Beyond Accuracy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05692","snapshot_observed_at":"2026-08-09T17:36:09.593630Z","title":"Evaluating mathematical reasoning beyond accuracy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.593630Z"},"links":{"cited_paper":"/paper/2404.05692","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:194fe8efbdaaf9de1cb492c77417e44335b40842592f8982cf9dbb113985704e","observation_id":"aa175261-3913-4a31-b455-920faa242b10","resolution":{"observed_at":"2026-08-09T17:36:09.593630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:09.597364Z","title":"The lean 4 theorem prover and programming language","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.597364Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:8ceca8e9a5a3b789fb5a012d1de5ef151015b5208125b047a9d15ff73074f803","observation_id":"a96324a1-090c-460b-9c6f-6ba5004baa86","resolution":{"observed_at":"2026-08-09T17:36:09.597364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:09.600543Z","title":"Isabelle: A generic theorem prover","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.600543Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:1caafab697374d0220486fb84b944c5c72c08201b3fa3f850aa9ecd5fa014aa0","observation_id":"a0b5dd55-cb6d-4b01-8b33-2a281145c171","resolution":{"observed_at":"2026-08-09T17:36:09.600543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:09.603515Z","title":"The coq proof assistant a tutorial","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.603515Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:17dfcd471a81fd20bb81484905f043f6d514bc6fa02d8ad54a04cda136338c7f","observation_id":"4719425c-dcbb-4594-b15b-5a0e8466dbe1","resolution":{"observed_at":"2026-08-09T17:36:09.603515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:09.606594Z","title":"Leandojo: Theorem proving with retrieval-augmented language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.606594Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:ce9b5996e80595eec8a2027cdb2254636aaa708d612f2fe3dd9f06bee9ae66e0","observation_id":"9c63c7c0-c915-40f5-959a-5cab0960a528","resolution":{"observed_at":"2026-08-09T17:36:09.606594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:09.609615Z","title":"Thor: Wielding hammers to integrate language models and automated theorem provers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.609615Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:a2c794bfd296c2a06b05e2831cacd518c2285f88d07d642a47248daa285c134a","observation_id":"9b0fda7f-b129-4043-a78a-994dc9aa6a37","resolution":{"observed_at":"2026-08-09T17:36:09.609615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.12283","last_updated":"2023-02-20T16:10:20Z","snapshot_observed_at":"2026-08-09T00:42:45.030767Z","submitted_at":"2022-10-21T22:37:22Z","title":"Draft, Sketch, and Prove: Guiding Formal Theorem Provers with Informal Proofs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.12283","snapshot_observed_at":"2026-08-09T17:36:09.612982Z","title":"Draft, sketch, and prove: Guiding formal theorem provers with informal proofs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.612982Z"},"links":{"cited_paper":"/paper/2210.12283","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:c49a10c9705f124a95556a57185b5deed792791a74e3d90a2a9e8f73b436afc7","observation_id":"9dfd4d5c-5d14-4ec0-b538-ab945a6f4055","resolution":{"observed_at":"2026-08-09T17:36:09.612982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:09.616356Z","title":"Baldur: Whole-proof generation and repair with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.616356Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:5a247aaa493742feec5267dfdf98ddb126781af2c27065e95ca09537f36ea0df","observation_id":"33370f08-92ce-4669-a42f-ae96a93c6fee","resolution":{"observed_at":"2026-08-09T17:36:09.616356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03203","last_updated":"2024-10-04T03:06:26Z","snapshot_observed_at":"2026-08-08T23:59:01.170425Z","submitted_at":"2024-07-03T15:36:18Z","title":"TheoremLlama: Transforming General-Purpose LLMs into Lean4 Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03203","snapshot_observed_at":"2026-08-09T17:36:09.619286Z","title":"Theoremllama: Transforming general-purpose llms into lean4 experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.619286Z"},"links":{"cited_paper":"/paper/2407.03203","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:431d2851ccc4ce8bb982b1cd3ca6618854d54efe7d893db92166f0f7a4c164c2","observation_id":"e0b55614-0113-486b-b881-35b0610bcf86","resolution":{"observed_at":"2026-08-09T17:36:09.619286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.12284","last_updated":"2024-05-03T17:36:07Z","snapshot_observed_at":"2026-08-02T15:00:50.388422Z","submitted_at":"2023-09-21T17:45:42Z","title":"MetaMath: Bootstrap Your Own Mathematical Questions for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.12284","snapshot_observed_at":"2026-08-09T17:36:09.622596Z","title":"Metamath: Bootstrap your own mathematical questions for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.622596Z"},"links":{"cited_paper":"/paper/2309.12284","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:ee615468b2d4aed08cc1002cf9ca38db859f71c8aaedc0f1911f482d839ebdbe","observation_id":"401c5ced-95d8-44dd-a157-a5ad13ebd946","resolution":{"observed_at":"2026-08-09T17:36:09.622596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:10.196553Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? In European Conference on Computer Vision, pages 169–186","venue":null,"work_id":"fb7d442d-7b28-4129-ae2e-213877757726","year":2025},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.625662Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:358c2e0a80c071aad3ed59d9c03c8be49cb6bf445cbb7b363739370c6e4afcbf","observation_id":"343d4693-79a4-4615-94f8-8ab3181eddb1","resolution":{"observed_at":"2026-08-09T17:36:10.199928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05221","last_updated":"2024-08-11T22:20:19Z","snapshot_observed_at":"2026-08-09T16:35:57.527702Z","submitted_at":"2024-04-08T06:35:09Z","title":"LLM Reasoners: New Evaluation, Library, and Analysis of Step-by-Step Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05221","snapshot_observed_at":"2026-08-09T17:36:09.628897Z","title":"Llm reasoners: New evaluation, library, and analysis of step-by-step reasoning with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.628897Z"},"links":{"cited_paper":"/paper/2404.05221","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:7b0867a3fc14e95c0f07177a14e8717f20dbcf6194b47d2cbcf2bb4e0ddf3bf4","observation_id":"5a350cd1-9f03-44ba-9458-0bbdcf69b8ce","resolution":{"observed_at":"2026-08-09T17:36:09.628897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11814","last_updated":"2024-02-19T04:08:44Z","snapshot_observed_at":"2026-08-09T21:05:54.403616Z","submitted_at":"2024-02-19T04:08:44Z","title":"An Empirical Evaluation of LLMs for Solving Offensive Security Challenges","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11814","snapshot_observed_at":"2026-08-09T17:36:09.632242Z","title":"An empirical evaluation of llms for solving offensive security challenges","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.632242Z"},"links":{"cited_paper":"/paper/2402.11814","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:adfc15096ce29623b548962e6a5ac722b0b103754eadc27bcdfd41e638412803","observation_id":"50f8e8cb-e477-46cc-b372-20167b0f48ea","resolution":{"observed_at":"2026-08-09T17:36:09.632242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:09.635508Z","title":"Cladder: Assessing causal reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.635508Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:f1a312ce517bc8faa260cf0fd48a36f9c683bdeb27995843c1d1becc6117f4db","observation_id":"8d72be25-55bf-4215-8434-89bde6f7f85f","resolution":{"observed_at":"2026-08-09T17:36:09.635508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:10.180784Z","title":"Using llms to facilitate formal verification of rtl","venue":null,"work_id":"c7cc02f0-dc2c-42f9-a166-9157b2b48747","year":2023},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.638581Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:31513cf57513d9de20d711063fd93b76accbec14f351a30002678b2465330105","observation_id":"8f438116-dd13-4aac-bbbf-21fd26c5fcbc","resolution":{"observed_at":"2026-08-09T17:36:10.184417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09395","last_updated":"2024-11-03T02:52:58Z","snapshot_observed_at":"2026-07-06T17:16:55.291514Z","submitted_at":"2024-01-17T18:13:07Z","title":"Evaluating LLMs' Mathematical and Coding Competency through Ontology-guided Interventions","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09395","snapshot_observed_at":"2026-08-09T17:36:09.641336Z","title":"Stuck in the quicksand of numeracy, far from agi summit: Evaluating llms’ mathematical competency through ontology-guided perturbations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.641336Z"},"links":{"cited_paper":"/paper/2401.09395","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:3a02ca5a486b5c285a8ac5124334b2e9b523d1a3014343e379eb93188155884a","observation_id":"e398a153-d0d9-43ab-8532-405143c50ea3","resolution":{"observed_at":"2026-08-09T17:36:09.641336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:09.644561Z","title":"Evaluating llms’ mathematical reasoning in financial document question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.644561Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:2b9ed5a55618e4a6e6e7c3c9626a37963814e337529d01004626163bd5b05718","observation_id":"4ad8c173-7105-47c4-b0e0-307126fad0a3","resolution":{"observed_at":"2026-08-09T17:36:09.644561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.10512","last_updated":"2025-05-08T03:45:24Z","snapshot_observed_at":"2026-07-06T15:43:54.377120Z","submitted_at":"2023-06-18T09:54:33Z","title":"Position: AI Evaluation Should Learn from How We Test Humans","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.10512","snapshot_observed_at":"2026-08-09T17:36:09.647330Z","title":"Efficiently measuring the cognitive ability of llms: An adaptive testing perspective","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.647330Z"},"links":{"cited_paper":"/paper/2306.10512","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:963b5185fc9298ee7498a78306dd664e5598510a0fcfc13ea2cd4123a5ef3116","observation_id":"68778ea7-cdff-46c2-b429-b893d4500153","resolution":{"observed_at":"2026-08-09T17:36:09.647330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14992","last_updated":"2024-05-26T22:27:23Z","snapshot_observed_at":"2026-08-05T12:01:06.707349Z","submitted_at":"2024-02-22T22:05:23Z","title":"tinyBenchmarks: evaluating LLMs with fewer examples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14992","snapshot_observed_at":"2026-08-09T17:36:09.650394Z","title":"tinybench- marks: evaluating llms with fewer examples","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.650394Z"},"links":{"cited_paper":"/paper/2402.14992","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:4d3173c346d7d493530d8b0412610aa564f21075369cd706b713131250b5e461","observation_id":"2673de03-43d8-4b24-994f-5e7c47ea5911","resolution":{"observed_at":"2026-08-09T17:36:09.650394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14191","last_updated":"2025-04-07T07:52:28Z","snapshot_observed_at":"2026-08-10T20:03:49.769456Z","submitted_at":"2024-05-23T05:34:31Z","title":"S-Eval: Towards Automated and Comprehensive Safety Evaluation for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14191","snapshot_observed_at":"2026-08-09T17:36:09.653389Z","title":"S-eval: Automatic and adaptive test generation for benchmarking safety evaluation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.653389Z"},"links":{"cited_paper":"/paper/2405.14191","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:92c20ca189557e7f4aaeda7ba79f560a7201a7489f8b83d30ae225f40b72495e","observation_id":"87a1d1c7-2a9d-4572-9231-8c09383047a7","resolution":{"observed_at":"2026-08-09T17:36:09.653389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:10.165346Z","title":"Psychometrics: an introduction","venue":null,"work_id":"97df121f-865f-49f4-8b93-4e1f1e95615a","year":2021},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.656619Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:7ec5976031e465b834e1b6e336cd28f06dcb6072ba3d5a8f03d8f11f44710cca","observation_id":"78fc73ac-c379-4366-8b99-5625f369895e","resolution":{"observed_at":"2026-08-09T17:36:10.168668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:10.156431Z","title":"Diagnostic measurement: Theory, methods, and applications","venue":null,"work_id":"1ca92e54-0b7a-4111-9fbd-81ec77a68fa9","year":2010},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.659369Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:d52ebcc64be25f0d6854efab3139f2a3a8862ed7bf51ef703f10488503180961","observation_id":"47d6942f-f917-4de4-a709-6d24bcb45c04","resolution":{"observed_at":"2026-08-09T17:36:10.159834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:10.147627Z","title":"A brief introduction to evidence-centered design","venue":null,"work_id":"9babb775-83b4-4696-8353-bb65b1f35dae","year":2003},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.662336Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:c1689cd5805591dc4a369c7a6c68666e432ae542d0ca2c19000ed920adf9022e","observation_id":"85cbad2c-13ad-41cd-84cb-c09283918815","resolution":{"observed_at":"2026-08-09T17:36:10.150856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:09.665270Z","title":"The basics of item response theory","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.665270Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:52ab45f64703672e2f3e8a78a0c86e20fe1b437381186d15d78209c3c67bfea0","observation_id":"fe1e5f72-840f-423a-ab35-605ab3140e3a","resolution":{"observed_at":"2026-08-09T17:36:09.665270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:10.132676Z","title":"Item response theory for psychologists, 2004","venue":null,"work_id":"aff91ea7-ce7b-4e7b-a6ec-f48f37170042","year":2004},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.668171Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:94e6c9c272484aa7bd1165fc0903c6cfdc2b2b8aa7eb7a97173d0f4f0ddfa0d3","observation_id":"ad463b42-6011-4d1c-b99e-f144a7832e5c","resolution":{"observed_at":"2026-08-09T17:36:10.136025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00110","last_updated":"2022-02-28T06:03:23Z","snapshot_observed_at":"2026-08-09T06:26:57.793642Z","submitted_at":"2021-08-31T23:21:12Z","title":"MiniF2F: a cross-system benchmark for formal Olympiad-level mathematics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00110","snapshot_observed_at":"2026-08-09T17:36:09.670922Z","title":"Minif2f: a cross-system benchmark for formal olympiad- level mathematics","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.670922Z"},"links":{"cited_paper":"/paper/2109.00110","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:78c5450a8abe7b01f14a42decb0c59d52c8a9eae5d52f68482e126180e1463b0","observation_id":"1896d037-6f6a-41db-9854-1a75eea3dde7","resolution":{"observed_at":"2026-08-09T17:36:09.670922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14333","last_updated":"2024-05-23T09:03:42Z","snapshot_observed_at":"2026-07-06T18:18:25.746022Z","submitted_at":"2024-05-23T09:03:42Z","title":"DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14333","snapshot_observed_at":"2026-08-09T17:36:09.674013Z","title":"Deepseek-prover: Advancing theorem proving in llms through large-scale synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.674013Z"},"links":{"cited_paper":"/paper/2405.14333","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:02e22c52dbe9a6160310aab510d5dcd03bf8051fa0cd42f32e0bf5d5fcb4fa90","observation_id":"700bd2d3-198a-429f-a4b0-079ebb0cdfff","resolution":{"observed_at":"2026-08-09T17:36:09.674013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:10.123331Z","title":null,"venue":null,"work_id":"5ed91c84-adef-486f-bfbf-7f986d69038d","year":2023},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.677295Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:49a9ee867151e92d61f4cdd99abd8b420f95b495042bca0618d4cbdf3c825a72","observation_id":"71011636-bb2e-40ab-8946-2254b05067d1","resolution":{"observed_at":"2026-08-09T17:36:10.126584Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-09T17:36:09.680237Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.680237Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:418a25846a7d64e33f1f317690d3e1dac468e506cceb8bbc38763801b0d46445","observation_id":"c6c94b34-ba09-4f4a-b1c9-104b90a3ff31","resolution":{"observed_at":"2026-08-09T17:36:09.680237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:09.683350Z","title":"Item response theory","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.683350Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:54c7dc8b70f43b2309b01d0cd037d1fac463133258053d00e12a2c3952a38186","observation_id":"081c51c7-9493-4b03-b3ea-a873f45d064d","resolution":{"observed_at":"2026-08-09T17:36:09.683350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:10.108200Z","title":"A tutorial on fisher information","venue":null,"work_id":"41f2b8f7-b4d5-497b-a9ce-e3aafbf28545","year":2017},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.686436Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:a0a50afb1b537670c3f4714d81fefb5664801d0b472b9b9232bd33c2ea9c65a4","observation_id":"85011a5e-a23a-4f63-b776-710aa2781705","resolution":{"observed_at":"2026-08-09T17:36:10.111480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:10.098712Z","title":"Codegeex: A pre-trained model for code generation with multilingual benchmarking on humaneval-x","venue":null,"work_id":"9b778d81-c230-4c95-ba52-08437d5eaa88","year":2023},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.689427Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:d28f21750287d07abc7cd0ee6f16243c54eeee20ab924d0562e7df1b5eb429c9","observation_id":"a57fdb7d-a90b-4869-9f32-dcfbd4540ea1","resolution":{"observed_at":"2026-08-09T17:36:10.102147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:09.692301Z","title":"Jiang, Jia Deng, Stella Biderman, and Sean Welleck","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.692301Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:87c79a167406240278f6fc8f151a29bb933080fcbe563ce3e515b7a5f57f23fd","observation_id":"e48c24e9-070d-45a2-8416-70530b903c9d","resolution":{"observed_at":"2026-08-09T17:36:09.692301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:10.084097Z","title":"Theoremllama: Transforming general-purpose llms into lean4 experts, 2024","venue":null,"work_id":"c0b9ace7-9da3-4735-a17b-8a32a3595ab7","year":2024},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.695142Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:0a750ea73d1594089de79292f2a8725cf2a6a473cf19e7c8c95c28abef5a58af","observation_id":"45a75fc9-f008-44f9-b42a-4806fb871dbc","resolution":{"observed_at":"2026-08-09T17:36:10.087594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-09T17:36:09.697940Z","title":"Code llama: Open foundation models for code","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.697940Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:a13ed739da5526d99d3755a6e75a265b5483a616d40d6e8062fc9ce378fff239","observation_id":"a526a880-7541-4b2e-8e37-bb6dc2793119","resolution":{"observed_at":"2026-08-09T17:36:09.697940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-09T17:36:09.701260Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.701260Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:95f010b87ed5872c33c853985de71fd9f8726c1f439ce9a3fb0b7a9a1784125a","observation_id":"c3e68a2c-1051-4db1-8559-8c665027fa83","resolution":{"observed_at":"2026-08-09T17:36:09.701260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-09T17:36:09.704602Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.704602Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:aaf6a55c416f6123e9d244d69f7196a6173b724eb9d7a27531f9b35a45cc4b00","observation_id":"34fdb993-c71c-49ec-b219-148b407bb726","resolution":{"observed_at":"2026-08-09T17:36:09.704602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:09.707633Z","title":"Lisa: Language models of isabelle proofs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.707633Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:2af9de298bd278eb02a5a61ccaa1553c3fa45ed7aba7030acdbc7ca27f449299","observation_id":"9b1b55d0-395b-4a56-b449-b2552450d9e8","resolution":{"observed_at":"2026-08-09T17:36:09.707633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12433","last_updated":"2023-02-24T03:28:46Z","snapshot_observed_at":"2026-08-08T08:53:38.852270Z","submitted_at":"2023-02-24T03:28:46Z","title":"ProofNet: Autoformalizing and Formally Proving Undergraduate-Level Mathematics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12433","snapshot_observed_at":"2026-08-09T17:36:09.710677Z","title":"Proofnet: Autoformalizing and formally proving undergraduate-level mathematics","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.710677Z"},"links":{"cited_paper":"/paper/2302.12433","citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:74295368453f7cdcbed4fa4dc72506fb01c0c569ec5d80e5a78e337b3ef0d712","observation_id":"47a8011d-b6bd-46a0-a65c-0c78c83290c4","resolution":{"observed_at":"2026-08-09T17:36:09.710677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:10.068984Z","title":null,"venue":null,"work_id":"0114429e-b028-46c7-8d0f-9410d140700f","year":2024},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.713621Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:a6d74c2075bab9d693349dd86d4291e5e69f25af9f7c900d5a5f387f8153bff1","observation_id":"cc6b863d-1272-4197-a4af-98b0f0d62e0b","resolution":{"observed_at":"2026-08-09T17:36:10.071927Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"records/1477613","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:09.819589Z","title":"A.2 Theorem Categories The theorems in miniF2F are classified using multiple criteria","venue":null,"work_id":"8210d430-5369-455e-86dd-8031895024c7","year":1974},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.716426Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:9733591c9cae63430634d53ceb52ef305ef4543c30368811bbe1a372db3d7cc2","observation_id":"ccc95c8b-89dd-4762-b411-bbb3302c9cc5","resolution":{"observed_at":"2026-08-09T17:36:09.826170Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:10.059897Z","title":null,"venue":null,"work_id":"1b2d684d-374d-43fa-87c9-75666c80e42c","year":null},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.719406Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:0965c4203c053cfd11f994b67fec80845c77d218a92838cefe9c59dc4a4f6bb6","observation_id":"1305f129-dd40-4bd0-b677-d1563d2588b8","resolution":{"observed_at":"2026-08-09T17:36:10.062820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:10.051340Z","title":"This is because, in the miniF2F design, the test set is reserved for evaluation, while the validation set may have been used during model training [32]","venue":null,"work_id":"d1294db4-ac82-4921-a8e4-8586e8f1e8ef","year":null},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.722439Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:4c0883e1e5406e205426c2027473c0fa63c4ec7dd12b8ea887cb609d39179bb5","observation_id":"84e96882-466d-4eba-9803-81063e4eb9da","resolution":{"observed_at":"2026-08-09T17:36:10.054541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:10.042922Z","title":"This is because competition problems tend to be more complex, but their higher complexity also leads to a lower discrimination","venue":null,"work_id":"97d84af7-4f44-4229-8d1b-29ded42012ab","year":null},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.725413Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:45f1440407f004925bbc63b116febd0f9f853ce9413fc298c7ca2be6577696a4","observation_id":"fbc1cf20-f683-405d-934f-a7e8adb54c62","resolution":{"observed_at":"2026-08-09T17:36:10.046114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:36:10.034413Z","title":null,"venue":null,"work_id":"a1734308-299a-4396-8df6-ecaab122a66e","year":1967},"citing_paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T17:36:09.728402Z"},"links":{"citing_paper":"/paper/2502.00855"},"observation_digest":"sha256:583edbea1e3a9f07bf98946e5408f1eb224fad83b989a918d5d784d9bb72129e","observation_id":"73b796a4-de88-45db-8199-08e445c71525","resolution":{"observed_at":"2026-08-09T17:36:10.037359Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.00855","last_updated":"2025-02-02T17:00:22Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-10T13:42:48.115704Z","submitted_at":"2025-02-02T17:00:22Z","title":"Psychometric-Based Evaluation for Theorem Proving with Large Language Models"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":1,"verified_fuzzy":11},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2502.00855."}