Pith. sign in

Paper Citation Record · LEDGER

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation

As of 19 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2607.23425.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2607.23425 v1

Coverage vector

measured 39 of 39 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-07-30T22:39:33.984319Z

measured 39 of 39 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

39 of 39 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved39
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 2bf794c6-2cc4-44f9-8adf-691d9ed5e9be · outbound

This paper cites an unresolved cited work.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Unresolved cited work

Reference 1

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.854996Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.854996Z digest=sha256:fb50c9049ce4593c98504661ab5aad13b038863ed48a86c9bc8c5a02c027f40c

Observation 38443d65-f564-453f-b823-ee685066a0ff · outbound

This paper cites Program Synthesis with Large Language Models.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Program Synthesis with Large Language Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.859180Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.859180Z digest=sha256:2763dca6950cd2f5aae0f8c9d00f8d1c5c5aaa71cebd2776b1a469020e4ef256

Observation e411e123-eae2-4d26-930a-4173b930e941 · outbound

This paper cites ProofNet: Autoformalizing and Formally Proving Undergraduate-Level Mathematics.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation ProofNet: Autoformalizing and Formally Proving Undergraduate-Level Mathematics

Reference 3

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.863515Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.863515Z digest=sha256:cf23bf99aa01e9252a585bad5a4d69192630e9e7b4b3a8e6a306791e58944e9c

Observation bd39d6ba-689f-4315-96f7-f59e1155d553 · outbound

This paper cites an unresolved cited work.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.868001Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.868001Z digest=sha256:449e850e8b2f1fb8540ea8a9a0468a2f9f0db0550b300c43cdbd4c5a6ef4db31

Observation e3401297-49dd-409b-bb78-123807d5b176 · outbound

This paper cites Thiruvathukal, Konstantin Läufer, and Mohammed Abuhamad.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Thiruvathukal, Konstantin Läufer, and Mohammed Abuhamad

Reference 5

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.871450Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.871450Z digest=sha256:734e754e5ce26d4b8d6e0d5b16a040196552b849f53855ebebda8ac0ab0bfde5

Observation db462410-379a-4c5d-91ac-3cb864863064 · outbound

This paper cites Thiruvathukal, Kon- stantin Läufer, and Mohammed Abuhamad.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Thiruvathukal, Kon- stantin Läufer, and Mohammed Abuhamad

Reference 6

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.874976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.874976Z digest=sha256:a6d938377c3ef5b48c4ecbd1e74ae84755514e40c2b33cfd9570347f36896dac

Observation ed2a9fd7-2cc6-4dcd-a329-7345f3798203 · outbound

This paper cites Evaluating Large Language Models Trained on Code.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Evaluating Large Language Models Trained on Code

Reference 7

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.878452Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.878452Z digest=sha256:b6f3b84669fe40bc2980e106d1a4e9583a8dabc8c36fc07d3cb24d55ce2bbe5f

Observation acdcec03-f06a-49cf-a514-3299be05920d · outbound

This paper cites an unresolved cited work.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Unresolved cited work

Reference 8

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.882001Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.882001Z digest=sha256:357aa0da4a3df63ac3cdfda5bbeb2eb68a1e5c15775d3d06fb9eae080eb4d65f

Observation bdb9584f-19f4-4132-9767-ffef085d1632 · outbound

This paper cites an unresolved cited work.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Unresolved cited work

Reference 9

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.885308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.885308Z digest=sha256:e29e330d19c32b56d8ebe1b112b2aaf1a90d9cec2a09d33d197aa8e94139ffd4

Observation a06c515d-6c94-46f0-8091-738c0b124327 · outbound

This paper cites an unresolved cited work.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Unresolved cited work

Reference 10

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.888538Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.888538Z digest=sha256:9f2263ff508a37223fc8cb7b67df65b66e5bcdf46c98350dce522c4078a30ffb

Observation 3275aafb-6df0-4e2b-9265-9a58a739d9c8 · outbound

This paper cites an unresolved cited work.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Unresolved cited work

Reference 11

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.895732Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.895732Z digest=sha256:b204ac6b934d060a34e50a72f4ab4cb6fc1f19b8e75b4b352d43aa2a7fad3a4f

Observation 29385bea-8c23-48e1-a8d9-466ea1a25fb8 · outbound

This paper cites an unresolved cited work.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Unresolved cited work

Reference 12

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.899890Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.899890Z digest=sha256:09b394ff8019db66e98a871b7d88f93f28d2e7ed70fae32beee97d6a1c83111d

Observation 85d7096d-cf91-4dd0-8b18-693823456a22 · outbound

This paper cites The Llama 3 Herd of Models.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation The Llama 3 Herd of Models

Reference 13

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.903178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.903178Z digest=sha256:52deb495ddd869a1d34bef394a0eecad72f9cbf6e2781f5ec17830a090c859c2

Observation 55191706-9ccf-43cd-9dfa-99eca598c70d · outbound

This paper cites Qwen2.5-Coder Technical Report.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Qwen2.5-Coder Technical Report

Reference 14

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.906576Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.906576Z digest=sha256:2b67b753301dbc46d17e9fd20aa4b7ffae7d86ece58340c4f149cfb2e6df2b63

Observation f3724783-144c-4456-b0f5-0627582681bd · outbound

This paper cites LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code

Reference 15

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.910066Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.910066Z digest=sha256:fb044ab69fb3e4294b46c12cb8cef88c0ea248270a8378158c1486785e94012c

Observation dd8f4e5e-bcb0-4329-97a1-715761c8326a · outbound

This paper cites SWE-bench: Can Language Models Resolve Real-World GitHub Issues?.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Reference 16

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.913301Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.913301Z digest=sha256:abf90e5a0a4ca9143772ee0a037a54343e65e5a5d7fd476c6573d8287f8e07cc

Observation 628dae10-14ae-4181-96e7-7a3514012098 · outbound

This paper cites an unresolved cited work.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Unresolved cited work

Reference 17

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.916640Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.916640Z digest=sha256:69a2063b733c88c1ba8345259a266b31aa7ac3d3463de3ec6c659029b036c37d

Observation 3dbb8319-5a4e-4025-b9b4-a9591e7c5e25 · outbound

This paper cites 2002.Specifying Systems: The TLA+ Language and Tools for Hardware and Software Engineers.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation 2002.Specifying Systems: The TLA+ Language and Tools for Hardware and Software Engineers

Reference 18

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.919773Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.919773Z digest=sha256:aad6430289b4e62e44e22d2348e5294eb2420237ac568a5f2ba7c4e99c31cb5e

Observation d5023e13-2698-4813-8f12-8638849516cc · outbound

This paper cites an unresolved cited work.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Unresolved cited work

Reference 19

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.923026Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.923026Z digest=sha256:167b40aa835ccde9f7ecab4af807504f42110a68e033a0beda702bdeaa19e876

Observation 7c0a8150-87f6-4687-bb49-766d6c50d18b · outbound

This paper cites Can LLMs Reason About Program Semantics? A Comprehensive Evaluation of LLMs on Formal Specification Inference.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Can LLMs Reason About Program Semantics? A Comprehensive Evaluation of LLMs on Formal Specification Inference

Reference 20

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.926067Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.926067Z digest=sha256:9956271461b933d4481ca32065173871baf2832c1363dcf6f0a051bf2ea43e8a

Observation d5732c5c-1f04-4850-ae29-5c652702d708 · outbound

This paper cites Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Is Your Code Generated by ChatGPT Really Correct? Rigorous Evaluation of Large Language Models for Code Generation

Reference 21

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.929232Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.929232Z digest=sha256:16918090ef5a0f21f61e8212f06aefd01c84e4a2e9a2004b0f1b52ed77eb2ca0

Observation 59fafebc-5519-4ee2-916c-e17434186360 · outbound

This paper cites an unresolved cited work.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Unresolved cited work

Reference 22

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.932390Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.932390Z digest=sha256:84a661a920021d28e02db8c52c1cc2c4e72fd1209e15cc2c19b2cab3d1f889ab

Observation b42a6cc6-5e2d-4810-b234-6efe78d93c65 · outbound

This paper cites an unresolved cited work.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Unresolved cited work

Reference 23

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.935419Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.935419Z digest=sha256:1e5b3b7efb71d973d1866838c901514c83a91443d6ae0bf9f54abddb205f6f61

Observation 08d7d937-b307-4c1e-a77b-be5513da35b7 · outbound

This paper cites DafnyBench: A Benchmark for Formal Software Verification.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation DafnyBench: A Benchmark for Formal Software Verification

Reference 24

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.938245Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.938245Z digest=sha256:45e6730ebe2eb6eb158b925a416f13133e304eac7fb500f0972662570d0ad4ac

Observation d6f3ec60-7bb5-4dcb-879f-c41f0c76b000 · outbound

This paper cites an unresolved cited work.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Unresolved cited work

Reference 25

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.941572Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.941572Z digest=sha256:faff8d5866a139dbb74b872ff97dc6ffdd65567dffe9264f23aed141e7a6e4ff

Observation 9672650d-2688-4aaf-9d83-f1b75308f379 · outbound

This paper cites an unresolved cited work.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Unresolved cited work

Reference 26

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.944813Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.944813Z digest=sha256:e96eec51e4a597bbf34ada313c87e4a3d864240395605a9906e571f69114b5a1

Observation b5c639c2-4dcd-44bd-b74c-0e4670ba6fae · outbound

This paper cites an unresolved cited work.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Unresolved cited work

Reference 27

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.947946Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.947946Z digest=sha256:3d55f72b14fbe9b10cc141091c9b89985585b0e30d695a66a69db06fbb7c7e9d

Observation ffb8bc5c-5013-4dfe-8042-d9db16fc59fd · outbound

This paper cites VarBench: Robust Language Model Benchmarking Through Dynamic Variable Perturbation.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation VarBench: Robust Language Model Benchmarking Through Dynamic Variable Perturbation

Reference 28

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.950950Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.950950Z digest=sha256:f9b50da058945627b40cb0601ae1d60d4d11f6787ef5af7ae45c6b12896a135a

Observation 4e620310-b062-4f61-879e-2e73cdbba299 · outbound

This paper cites OpenClassGen: A Large-Scale Corpus of Real-World Python Classes for LLM Research.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation OpenClassGen: A Large-Scale Corpus of Real-World Python Classes for LLM Research

Reference 29

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.954121Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.954121Z digest=sha256:1153d4b204cb8fa561e7f6d2b7e29de289488df4fc69dff40e0c63cf32f145b8

Observation 8f1eccb1-b79d-4c30-83f7-f3e64ecd3c15 · outbound

This paper cites Clover: Closed-Loop Verifiable Code Generation.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Clover: Closed-Loop Verifiable Code Generation

Reference 30

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.957458Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.957458Z digest=sha256:9c808f04648e50614a96941839934d5e6658a128ae44574628b54be9971a9738

Observation 6c2bace3-6aae-4697-81a4-c168aa845406 · outbound

This paper cites Autoformalization in the Era of Large Language Models: A Survey.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Autoformalization in the Era of Large Language Models: A Survey

Reference 31

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.960764Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.960764Z digest=sha256:f817e6fa14bdab13dbb2e91d5471ea02853ca7420f38e05afb20d7ce9aff36d7

Observation 98b79ae0-b66e-49a9-8663-674f3d908668 · outbound

This paper cites LiveBench: A Challenging, Contamination-Limited LLM Benchmark.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation LiveBench: A Challenging, Contamination-Limited LLM Benchmark

Reference 32

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.964120Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.964120Z digest=sha256:6111b65a82179f2c52b5b7b3e6fdf5eadce092b086c6b82a99124bdd59ccda36

Observation 6e8bf887-cbac-41ef-982f-4335ba1b88f9 · outbound

This paper cites Jiang, Wenda Li, Markus N.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Jiang, Wenda Li, Markus N

Reference 33

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.967763Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.967763Z digest=sha256:e9d9989219e1074a188ed1b2f7e71f7c26293e1296fd6a9aa0fff507d2812f95

Observation 394cfa9c-71f9-4a7c-893a-721d7d99bd08 · outbound

This paper cites Benchmark Data Contamination of Large Language Models: A Survey.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Benchmark Data Contamination of Large Language Models: A Survey

Reference 34

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.970822Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.970822Z digest=sha256:9c6dd1f7eead046f960242c2ed59709dd03019ada9d3ac6d884cf0efbe02e657

Observation fe3afa99-3b4a-41e2-af35-71953c3da05a · outbound

This paper cites LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation LiveFMBench: Unveiling the Power and Limits of Agentic Workflows in Specification Generation

Reference 35

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.974358Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.974358Z digest=sha256:9f69e73312d1b311ed1d0b990c1ef8a044a79a975554f3918f0b308873c97df2

Observation 4ba2b003-82ff-4631-b7c5-caeba2ec90a2 · outbound

This paper cites LeanDojo: Theorem Proving with Retrieval-Augmented Language Models.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation LeanDojo: Theorem Proving with Retrieval-Augmented Language Models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.977915Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.977915Z digest=sha256:8cbad224de098f63fdee6237dc97cc993a22fbf9742e20117bbd009137a7fd2b

Observation 3f9212f4-92aa-490a-a492-95e801fdf547 · outbound

This paper cites an unresolved cited work.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Unresolved cited work

Reference 37

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.981257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.981257Z digest=sha256:b2b2fb16996d7bc774a44b73df4f60fe07b36a418ac97a566f9b8fccafc54c44

Observation 40289591-417c-4a50-aa07-395d7ed23850 · outbound

This paper cites A Careful Examination of Large Language Model Performance on Grade School Arithmetic.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation A Careful Examination of Large Language Model Performance on Grade School Arithmetic

Reference 38

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.984319Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.984319Z digest=sha256:0c654817e7cca6fb861df5952d4e6ae1d73fd22b519411cf6644e6ec41888b45

Observation 9ac30b7d-918e-4f6f-a590-eda71cb5a2a2 · outbound

This paper cites Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language Models.

TLA+-Bench: An Execution-Grounded Benchmark and Dataset for Natural-Language to TLA Specification Generation Generalization or Memorization: Data Contamination and Trustworthy Evaluation for Large Language Models

Reference 2024

Resolution
unresolved
no resolver link, observed 2026-07-30T22:39:33.891794Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-30T22:39:33.891794Z digest=sha256:63082917bbbff9d5fcd788a9cf89700464e3d5ae167fbb563bf4dc0eeaeaf803

Pith citing papers

No inbound Pith citation observations are available.