Pith. sign in

Paper Citation Record · LEDGER

HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems

As of 22 August 2026, this Paper Citation Record lists 8 of 8 outbound references and 0 inbound Pith citation observations for arXiv:2502.00226.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.00226 v1

Coverage vector

measured 8 of 8 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T19:46:23.635504Z

measured 8 of 8 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-22T06:32:14.747728+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

8 of 8 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved8
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation c0188b4d-f77f-400f-b809-c542f336ef2e · outbound

This paper cites HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation.

HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems HumanEval Pro and MBPP Pro: Evaluating Large Language Models on Self-invoking Code Generation

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T19:46:23.589246Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T19:46:23.589246Z digest=sha256:d16f0cbfc1e28340937e586576d4f8da6df3a7f37bd0622cbc3a5265d63d7830

Observation a5472529-8f3f-4855-a760-60bbce9b0ebd · outbound

This paper cites SWE-bench: Can Language Models Resolve Real-World GitHub Issues?.

HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems SWE-bench: Can Language Models Resolve Real-World GitHub Issues?

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-09T19:46:23.596333Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T19:46:23.596333Z digest=sha256:c9bae4fa57a16d7dec08f0fdc73aa6b8535a8d87c70d5959a09d726a4679a49d

Observation 45939f3d-620a-46b6-85e1-1f2ce27f1231 · outbound

This paper cites SWE-bench Multimodal: Do AI Systems Generalize to Visual Software Domains?.

HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems SWE-bench Multimodal: Do AI Systems Generalize to Visual Software Domains?

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-09T19:46:23.602920Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T19:46:23.602920Z digest=sha256:6d0c71128173fd99e3ccbd3368c7c39eb0ab0f05e55bb2290bc46ad680dd7551

Observation 3d1a30ce-b9ac-4416-b692-f81861dea393 · outbound

This paper cites DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories.

HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems DevEval: A Manually-Annotated Code Generation Benchmark Aligned with Real-World Code Repositories

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-09T19:46:23.609043Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T19:46:23.609043Z digest=sha256:7b5a90529465ac5ad641135746b0eaf74bb675a616d7a20db71285cfc7a7aa00

Observation 05b2843a-be17-4e07-a091-5aa9935f771a · outbound

This paper cites Enhancing Large Language Models in Coding Through Multi-Perspective Self-Consistency.

HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems Enhancing Large Language Models in Coding Through Multi-Perspective Self-Consistency

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-09T19:46:23.615149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T19:46:23.615149Z digest=sha256:538c816ea2ae479c8395bdaaa0f97b44f92e1a710860cfbef9b270944c74a608

Observation abfbb0e0-656b-4b1e-92a5-d5f25c2dccbd · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-09T19:46:23.621432Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T19:46:23.621432Z digest=sha256:4a03fa08e64ba7c5c6f7470589ade9c2b41073a42b35f388b86a2a551abdd2b1

Observation e0156aa4-85de-49ac-8a05-1faef45343f4 · outbound

This paper cites AgentBench: Evaluating LLMs as Agents.

HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems AgentBench: Evaluating LLMs as Agents

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-09T19:46:23.628097Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T19:46:23.628097Z digest=sha256:4e1d7812e741227e9d39b7002f34fcb3c71fbb2a98195d88789e65f8ecf223c8

Observation 0b1e7f17-7f48-4c2c-952d-dd87aa842518 · outbound

This paper cites MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation.

HackerRank-ASTRA: Evaluating Correctness & Consistency of Large Language Models on cross-domain multi-file project problems MLAgentBench: Evaluating Language Agents on Machine Learning Experimentation

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-09T19:46:23.635504Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T19:46:23.635504Z digest=sha256:1f5c7442a2565366e71d5e9d96583c6547daccf9240da087feb4cafd45f96ee7

Pith citing papers

No inbound Pith citation observations are available.