{"as_of":"2026-08-19T05:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4d156658afb71ba11bc3bda0d8994ab10db2a6f1b87661cc997ab400ec56054e","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T22:39:33.984319Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23425/citation-record","integrity":"/paper/2607.23425/integrity","json":"/paper/2607.23425/citation-record.json","paper":"/paper/2607.23425"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T22:39:33.854996Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.854996Z"},"links":{"citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:fb50c9049ce4593c98504661ab5aad13b038863ed48a86c9bc8c5a02c027f40c","observation_id":"2bf794c6-2cc4-44f9-8adf-691d9ed5e9be","resolution":{"observed_at":"2026-07-30T22:39:33.854996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-15T17:40:38.050939Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-07-30T22:39:33.859180Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.859180Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:2763dca6950cd2f5aae0f8c9d00f8d1c5c5aaa71cebd2776b1a469020e4ef256","observation_id":"38443d65-f564-453f-b823-ee685066a0ff","resolution":{"observed_at":"2026-07-30T22:39:33.859180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12433","last_updated":"2023-02-24T03:28:46Z","snapshot_observed_at":"2026-08-16T15:53:03.437287Z","submitted_at":"2023-02-24T03:28:46Z","title":"ProofNet: Autoformalizing and Formally Proving Undergraduate-Level Mathematics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12433","snapshot_observed_at":"2026-07-30T22:39:33.863515Z","title":"Ayers, Dragomir Radev, and Jeremy Avigad","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.863515Z"},"links":{"cited_paper":"/paper/2302.12433","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:cf23bf99aa01e9252a585bad5a4d69192630e9e7b4b3a8e6a306791e58944e9c","observation_id":"e411e123-eae2-4d26-930a-4173b930e941","resolution":{"observed_at":"2026-07-30T22:39:33.863515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T22:39:33.868001Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.868001Z"},"links":{"citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:449e850e8b2f1fb8540ea8a9a0468a2f9f0db0550b300c43cdbd4c5a6ef4db31","observation_id":"bd39d6ba-689f-4315-96f7-f59e1155d553","resolution":{"observed_at":"2026-07-30T22:39:33.868001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T22:39:33.871450Z","title":"Thiruvathukal, Konstantin Läufer, and Mohammed Abuhamad","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.871450Z"},"links":{"citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:734e754e5ce26d4b8d6e0d5b16a040196552b849f53855ebebda8ac0ab0bfde5","observation_id":"e3401297-49dd-409b-bb78-123807d5b176","resolution":{"observed_at":"2026-07-30T22:39:33.871450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T22:39:33.874976Z","title":"Thiruvathukal, Kon- stantin Läufer, and Mohammed Abuhamad","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.874976Z"},"links":{"citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:a6d938377c3ef5b48c4ecbd1e74ae84755514e40c2b33cfd9570347f36896dac","observation_id":"db462410-379a-4c5d-91ac-3cb864863064","resolution":{"observed_at":"2026-07-30T22:39:33.874976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-07-30T22:39:33.878452Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.878452Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:b6f3b84669fe40bc2980e106d1a4e9583a8dabc8c36fc07d3cb24d55ce2bbe5f","observation_id":"ed2a9fd7-2cc6-4dcd-a329-7345f3798203","resolution":{"observed_at":"2026-07-30T22:39:33.878452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T22:39:33.882001Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.882001Z"},"links":{"citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:357aa0da4a3df63ac3cdfda5bbeb2eb68a1e5c15775d3d06fb9eae080eb4d65f","observation_id":"acdcec03-f06a-49cf-a514-3299be05920d","resolution":{"observed_at":"2026-07-30T22:39:33.882001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T22:39:33.885308Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.885308Z"},"links":{"citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:e29e330d19c32b56d8ebe1b112b2aaf1a90d9cec2a09d33d197aa8e94139ffd4","observation_id":"bdb9584f-19f4-4132-9767-ffef085d1632","resolution":{"observed_at":"2026-07-30T22:39:33.885308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T22:39:33.888538Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.888538Z"},"links":{"citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:9f2263ff508a37223fc8cb7b67df65b66e5bcdf46c98350dce522c4078a30ffb","observation_id":"a06c515d-6c94-46f0-8091-738c0b124327","resolution":{"observed_at":"2026-07-30T22:39:33.888538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T22:39:33.895732Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.895732Z"},"links":{"citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:b204ac6b934d060a34e50a72f4ab4cb6fc1f19b8e75b4b352d43aa2a7fad3a4f","observation_id":"3275aafb-6df0-4e2b-9265-9a58a739d9c8","resolution":{"observed_at":"2026-07-30T22:39:33.895732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T22:39:33.899890Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.899890Z"},"links":{"citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:09b394ff8019db66e98a871b7d88f93f28d2e7ed70fae32beee97d6a1c83111d","observation_id":"29385bea-8c23-48e1-a8d9-466ea1a25fb8","resolution":{"observed_at":"2026-07-30T22:39:33.899890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-30T22:39:33.903178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.903178Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:52deb495ddd869a1d34bef394a0eecad72f9cbf6e2781f5ec17830a090c859c2","observation_id":"85d7096d-cf91-4dd0-8b18-693823456a22","resolution":{"observed_at":"2026-07-30T22:39:33.903178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-07-30T22:39:33.906576Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.906576Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:2b67b753301dbc46d17e9fd20aa4b7ffae7d86ece58340c4f149cfb2e6df2b63","observation_id":"55191706-9ccf-43cd-9dfa-99eca598c70d","resolution":{"observed_at":"2026-07-30T22:39:33.906576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-08-16T07:05:57.323612Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-07-30T22:39:33.910066Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.910066Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:fb044ab69fb3e4294b46c12cb8cef88c0ea248270a8378158c1486785e94012c","observation_id":"f3724783-144c-4456-b0f5-0627582681bd","resolution":{"observed_at":"2026-07-30T22:39:33.910066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-18T08:11:45.716032Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-07-30T22:39:33.913301Z","title":"Jimenez, John Yang, Alexander Wettig, Shunyu Yao, Kexin Pei, Ofir Press, and Karthik Narasimhan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.913301Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:abf90e5a0a4ca9143772ee0a037a54343e65e5a5d7fd476c6573d8287f8e07cc","observation_id":"dd8f4e5e-bcb0-4329-97a1-715761c8326a","resolution":{"observed_at":"2026-07-30T22:39:33.913301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T22:39:33.916640Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.916640Z"},"links":{"citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:69a2063b733c88c1ba8345259a266b31aa7ac3d3463de3ec6c659029b036c37d","observation_id":"628dae10-14ae-4181-96e7-7a3514012098","resolution":{"observed_at":"2026-07-30T22:39:33.916640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T22:39:33.919773Z","title":"2002.Specifying Systems: The TLA+ Language and Tools for Hardware and Software Engineers","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.919773Z"},"links":{"citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:aad6430289b4e62e44e22d2348e5294eb2420237ac568a5f2ba7c4e99c31cb5e","observation_id":"3dbb8319-5a4e-4025-b9b4-a9591e7c5e25","resolution":{"observed_at":"2026-07-30T22:39:33.919773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T22:39:33.923026Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.923026Z"},"links":{"citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:167b40aa835ccde9f7ecab4af807504f42110a68e033a0beda702bdeaa19e876","observation_id":"d5023e13-2698-4813-8f12-8638849516cc","resolution":{"observed_at":"2026-07-30T22:39:33.923026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04779","last_updated":"2025-05-29T06:07:32Z","snapshot_observed_at":"2026-08-16T12:56:06.896880Z","submitted_at":"2025-02-22T13:27:31Z","title":"Can LLMs Reason About Program Semantics? A Comprehensive Evaluation of LLMs on Formal Specification Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04779","snapshot_observed_at":"2026-07-30T22:39:33.926067Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.926067Z"},"links":{"cited_paper":"/paper/2503.04779","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:9956271461b933d4481ca32065173871baf2832c1363dcf6f0a051bf2ea43e8a","observation_id":"7c0a8150-87f6-4687-bb49-766d6c50d18b","resolution":{"observed_at":"2026-07-30T22:39:33.926067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01210","last_updated":"2023-10-30T19:37:09Z","snapshot_observed_at":"2026-08-12T18:11:04.754824Z","submitted_at":"2023-05-02T05:46:48Z","title":"Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01210","snapshot_observed_at":"2026-07-30T22:39:33.929232Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.929232Z"},"links":{"cited_paper":"/paper/2305.01210","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:16918090ef5a0f21f61e8212f06aefd01c84e4a2e9a2004b0f1b52ed77eb2ca0","observation_id":"d5732c5c-1f04-4850-ae29-5c652702d708","resolution":{"observed_at":"2026-07-30T22:39:33.929232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T22:39:33.932390Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.932390Z"},"links":{"citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:84a661a920021d28e02db8c52c1cc2c4e72fd1209e15cc2c19b2cab3d1f889ab","observation_id":"59fafebc-5519-4ee2-916c-e17434186360","resolution":{"observed_at":"2026-07-30T22:39:33.932390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T22:39:33.935419Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.935419Z"},"links":{"citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:1e5b3b7efb71d973d1866838c901514c83a91443d6ae0bf9f54abddb205f6f61","observation_id":"b42a6cc6-5e2d-4810-b234-6efe78d93c65","resolution":{"observed_at":"2026-07-30T22:39:33.935419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08467","last_updated":"2024-06-12T17:53:31Z","snapshot_observed_at":"2026-08-16T13:43:38.124764Z","submitted_at":"2024-06-12T17:53:31Z","title":"DafnyBench: A Benchmark for Formal Software Verification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08467","snapshot_observed_at":"2026-07-30T22:39:33.938245Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.938245Z"},"links":{"cited_paper":"/paper/2406.08467","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:45e6730ebe2eb6eb158b925a416f13133e304eac7fb500f0972662570d0ad4ac","observation_id":"08d7d937-b307-4c1e-a77b-be5513da35b7","resolution":{"observed_at":"2026-07-30T22:39:33.938245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T22:39:33.941572Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.941572Z"},"links":{"citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:faff8d5866a139dbb74b872ff97dc6ffdd65567dffe9264f23aed141e7a6e4ff","observation_id":"d6f3ec60-7bb5-4dcb-879f-c41f0c76b000","resolution":{"observed_at":"2026-07-30T22:39:33.941572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T22:39:33.944813Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.944813Z"},"links":{"citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:e96eec51e4a597bbf34ada313c87e4a3d864240395605a9906e571f69114b5a1","observation_id":"9672650d-2688-4aaf-9d83-f1b75308f379","resolution":{"observed_at":"2026-07-30T22:39:33.944813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T22:39:33.947946Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.947946Z"},"links":{"citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:3d55f72b14fbe9b10cc141091c9b89985585b0e30d695a66a69db06fbb7c7e9d","observation_id":"b5c639c2-4dcd-44bd-b74c-0e4670ba6fae","resolution":{"observed_at":"2026-07-30T22:39:33.947946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17681","last_updated":"2024-06-26T15:21:49Z","snapshot_observed_at":"2026-08-19T03:53:45.848475Z","submitted_at":"2024-06-25T16:13:53Z","title":"VarBench: Robust Language Model Benchmarking Through Dynamic Variable Perturbation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17681","snapshot_observed_at":"2026-07-30T22:39:33.950950Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.950950Z"},"links":{"cited_paper":"/paper/2406.17681","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:f9b50da058945627b40cb0601ae1d60d4d11f6787ef5af7ae45c6b12896a135a","observation_id":"ffb8bc5c-5013-4dfe-8042-d9db16fc59fd","resolution":{"observed_at":"2026-07-30T22:39:33.950950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15564","last_updated":"2026-04-30T17:27:03Z","snapshot_observed_at":"2026-08-14T12:59:06.067910Z","submitted_at":"2025-04-22T03:33:57Z","title":"OpenClassGen: A Large-Scale Corpus of Real-World Python Classes for LLM Research","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15564","snapshot_observed_at":"2026-07-30T22:39:33.954121Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.954121Z"},"links":{"cited_paper":"/paper/2504.15564","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:1153d4b204cb8fa561e7f6d2b7e29de289488df4fc69dff40e0c63cf32f145b8","observation_id":"4e620310-b062-4f61-879e-2e73cdbba299","resolution":{"observed_at":"2026-07-30T22:39:33.954121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17807","last_updated":"2024-11-16T21:57:49Z","snapshot_observed_at":"2026-08-17T12:05:32.577817Z","submitted_at":"2023-10-26T22:58:19Z","title":"Clover: Closed-Loop Verifiable Code Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17807","snapshot_observed_at":"2026-07-30T22:39:33.957458Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.957458Z"},"links":{"cited_paper":"/paper/2310.17807","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:9c808f04648e50614a96941839934d5e6658a128ae44574628b54be9971a9738","observation_id":"8f1eccb1-b79d-4c30-83f7-f3e64ecd3c15","resolution":{"observed_at":"2026-07-30T22:39:33.957458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23486","last_updated":"2025-07-03T06:03:07Z","snapshot_observed_at":"2026-08-07T12:42:44.667182Z","submitted_at":"2025-05-29T14:34:54Z","title":"Autoformalization in the Era of Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23486","snapshot_observed_at":"2026-07-30T22:39:33.960764Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.960764Z"},"links":{"cited_paper":"/paper/2505.23486","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:f817e6fa14bdab13dbb2e91d5471ea02853ca7420f38e05afb20d7ce9aff36d7","observation_id":"6c2bace3-6aae-4697-81a4-c168aa845406","resolution":{"observed_at":"2026-07-30T22:39:33.960764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19314","last_updated":"2025-04-18T19:36:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-27T16:47:42Z","title":"LiveBench: A Challenging, Contamination-Limited LLM Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19314","snapshot_observed_at":"2026-07-30T22:39:33.964120Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.964120Z"},"links":{"cited_paper":"/paper/2406.19314","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:6111b65a82179f2c52b5b7b3e6fdf5eadce092b086c6b82a99124bdd59ccda36","observation_id":"98b79ae0-b66e-49a9-8663-674f3d908668","resolution":{"observed_at":"2026-07-30T22:39:33.964120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T22:39:33.967763Z","title":"Jiang, Wenda Li, Markus N","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.967763Z"},"links":{"citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:e9d9989219e1074a188ed1b2f7e71f7c26293e1296fd6a9aa0fff507d2812f95","observation_id":"6e8bf887-cbac-41ef-982f-4335ba1b88f9","resolution":{"observed_at":"2026-07-30T22:39:33.967763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04244","last_updated":"2024-06-06T16:41:39Z","snapshot_observed_at":"2026-08-17T14:15:23.870937Z","submitted_at":"2024-06-06T16:41:39Z","title":"Benchmark Data Contamination of Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04244","snapshot_observed_at":"2026-07-30T22:39:33.970822Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.970822Z"},"links":{"cited_paper":"/paper/2406.04244","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:9c6dd1f7eead046f960242c2ed59709dd03019ada9d3ac6d884cf0efbe02e657","observation_id":"394cfa9c-71f9-4a7c-893a-721d7d99bd08","resolution":{"observed_at":"2026-07-30T22:39:33.970822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.01394","last_updated":"2026-05-02T11:31:33Z","snapshot_observed_at":"2026-08-17T18:02:45.225466Z","submitted_at":"2026-05-02T11:31:33Z","title":"LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.01394","snapshot_observed_at":"2026-07-30T22:39:33.974358Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.974358Z"},"links":{"cited_paper":"/paper/2605.01394","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:9f69e73312d1b311ed1d0b990c1ef8a044a79a975554f3918f0b308873c97df2","observation_id":"fe3afa99-3b4a-41e2-af35-71953c3da05a","resolution":{"observed_at":"2026-07-30T22:39:33.974358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15626","last_updated":"2023-10-27T16:00:20Z","snapshot_observed_at":"2026-08-16T15:20:40.279997Z","submitted_at":"2023-06-27T17:05:32Z","title":"LeanDojo: Theorem Proving with Retrieval-Augmented Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15626","snapshot_observed_at":"2026-07-30T22:39:33.977915Z","title":"Swope, Alex Gu, Rahul Chalamala, Peiyang Song, Shix- ing Yu, Saad Godil, Ryan Prenger, and Anima Anandkumar","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.977915Z"},"links":{"cited_paper":"/paper/2306.15626","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:8cbad224de098f63fdee6237dc97cc993a22fbf9742e20117bbd009137a7fd2b","observation_id":"4ba2b003-82ff-4631-b7c5-caeba2ec90a2","resolution":{"observed_at":"2026-07-30T22:39:33.977915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T22:39:33.981257Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.981257Z"},"links":{"citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:b2b2fb16996d7bc774a44b73df4f60fe07b36a418ac97a566f9b8fccafc54c44","observation_id":"3f9212f4-92aa-490a-a492-95e801fdf547","resolution":{"observed_at":"2026-07-30T22:39:33.981257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00332","last_updated":"2024-11-22T22:27:49Z","snapshot_observed_at":"2026-08-17T05:00:40.508036Z","submitted_at":"2024-05-01T05:52:05Z","title":"A Careful Examination of Large Language Model Performance on Grade School Arithmetic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00332","snapshot_observed_at":"2026-07-30T22:39:33.984319Z","title":"{description}","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.984319Z"},"links":{"cited_paper":"/paper/2405.00332","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:0c654817e7cca6fb861df5952d4e6ae1d73fd22b519411cf6644e6ec41888b45","observation_id":"40289591-417c-4a50-aa07-395d7ed23850","resolution":{"observed_at":"2026-07-30T22:39:33.984319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15938","last_updated":"2024-05-31T17:49:03Z","snapshot_observed_at":"2026-08-16T14:15:37.713855Z","submitted_at":"2024-02-24T23:54:41Z","title":"Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15938","snapshot_observed_at":"2026-07-30T22:39:33.891794Z","title":"ACL 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-30T22:39:33.891794Z"},"links":{"cited_paper":"/paper/2402.15938","citing_paper":"/paper/2607.23425"},"observation_digest":"sha256:78eb52f66c32b8a042818f7af28aa90190df050567e7f49a3d856ac7c6777428","observation_id":"9ac30b7d-918e-4f6f-a590-eda71cb5a2a2","resolution":{"observed_at":"2026-07-30T22:39:33.891794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23425","last_updated":"2026-07-26T02:49:56Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-08-11T20:27:29.196092Z","submitted_at":"2026-07-26T02:49:56Z","title":"TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2607.23425."}