Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links
Paper Citation Record · LEDGER
As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 15 inbound Pith citation observations for arXiv:2406.05761.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links, observed 2026-08-16T11:34:42.280569Z
A source-named dated measurement, never combined with another source.
Source: arxiv_reference, observed 2026-07-02T02:36:27.452622Z
0 of 0 outbound references displayed
External citation measurements
No source-named external measurement is stored.
No outbound reference observations are available for this paper version.
Observation 3f67dbd6-a5e2-4f4f-9e15-6e82d5d3ef93 · inbound
OpenScholar: Synthesizing Scientific Literature with Retrieval-augmented LMs The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models
Reference 2020
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 14d1d0cc-b665-4a4b-b844-73eec63fc032 · inbound
Explore Theory of Mind: Program-guided adversarial data generation for theory of mind reasoning The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models
Reference 17
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d0960f4e-fff1-46d6-96c4-885849d85175 · inbound
GLIDER: Grading LLM Interactions and Decisions using Explainable Ranking The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models
Reference 2023
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation edf4a044-44f1-432b-a217-65ca0d19f1f8 · inbound
MetaSC: Test-Time Safety Specification Optimization for Language Models The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models
Reference 2025
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1f62dacc-111b-4c33-981d-f83a21f7aca7 · inbound
Salamandra Technical Report The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models
Reference 87
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 52971542-9699-47ac-9a56-320483853afa · inbound
EvalAgent: Discovering Implicit Evaluation Criteria from the Web The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 022857c0-015a-464c-bfbd-d7c1624d3580 · inbound
Trillion 7B Technical Report The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models
Reference 28
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 67ce7fc7-be5d-400a-9375-59c2bb7de809 · inbound
Decentralized Arena: Towards Democratic and Scalable Automatic Evaluation of Language Models The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models
Reference 51
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 9bcc8e31-95e2-4215-9e50-b123a60c7ee0 · inbound
RewardAnything: Generalizable Principle-Following Reward Models The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models
Reference 75
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2f7fa853-9edd-4b9b-b9f2-82d2ba362b9c · inbound
Aligning Large Language Models with Implicit Preferences from User-Generated Content The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 840b7fc9-1e0e-4dcc-99f5-49bfd2af4791 · inbound
An Empirical Study of LLM-as-a-Judge: How Design Choices Impact Evaluation Reliability The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models
Reference 10
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 7d636483-3ae0-4150-890f-df653d0b1174 · inbound
Evalet: Evaluating Large Language Models through Functional Fragmentation The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models
Reference 37
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation d9e87539-1a81-450a-b433-0784c542ef95 · inbound
Detecting Unfaithful Chain-of-Thought via Circuit-Guided Internal-External Discrepancy The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models
Reference 25
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation d42c853c-44aa-4875-99eb-f390e9b72887 · inbound
CoEval: Ranking Language Models for Custom Tasks Without Labeled Data or Trustworthy Benchmarks The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models
Reference 7
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.
Observation acad77c1-3bac-4ea6-ac20-e78029278a30 · inbound
FinReportBench: Measuring and Improving Institution-Grade Financial Report Generation The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models
Reference 37
Source-reported events for the cited work
Unavailable: canonical work link unavailable.