Pith. sign in

Paper Citation Record · LEDGER

Style Over Substance: Evaluation Biases for Large Language Models

As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2307.03025.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2307.03025 v3

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 12 of 12 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-09T06:31:02.800959+00:00

measured 12 of 12 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-08T20:45:46.413279Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-16T18:44:49.756684Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 979eb0c7-d7ae-4ed5-96e6-747c2ef24814 · inbound

Lessons from the Trenches on Reproducible Evaluation of Language Models cites this paper.

Lessons from the Trenches on Reproducible Evaluation of Language Models Style Over Substance: Evaluation Biases for Large Language Models

Reference 87

Resolution
verified exact
arxiv_id, observed 2026-05-16T18:44:49.758379Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-05-16T18:44:49.519995Z digest=sha256:1f73211b89dc89a7ccdc5a6dcf1ef08a47a69f24df0b82bd7f0412860e2d6551

Observation e428d63a-d37a-465e-a4d8-978807aefe61 · inbound

Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge cites this paper.

Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge Style Over Substance: Evaluation Biases for Large Language Models

Reference 1

Resolution
metadata mismatch
arxiv_id, observed 2026-05-15T20:00:24.675263Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-15T20:00:24.651351Z digest=sha256:475843f4e07719eb81e31c5fcf594677ab3afd7f594e109b0ae31cdecb9bb93c

Observation ac8ee51a-41a3-4b1b-87e6-4d869c392b52 · inbound

Aligning Black-box Language Models with Human Judgments cites this paper.

Aligning Black-box Language Models with Human Judgments Style Over Substance: Evaluation Biases for Large Language Models

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-08T20:45:46.413279Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-08T20:45:46.413279Z digest=sha256:f37bc883ed66a2efa486fe5e15d3fd25d14b2a5ad69a6893910d9a7936d2a93e

Observation 40181927-339b-43a7-a7de-612c9d6b22e5 · inbound

AI Alignment at Your Discretion cites this paper.

AI Alignment at Your Discretion Style Over Substance: Evaluation Biases for Large Language Models

Reference 110

Resolution
unresolved
no resolver link, observed 2026-08-08T16:14:57.557238Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T16:14:57.557238Z digest=sha256:9a1b6b33a3a323bf5ea6b1d56e70543f5c5b46671c3e61127bd43b1159f1a6d8

Observation 3b0b9ea3-5cbf-4690-9ad7-bc2719816663 · inbound

Simple and Effective Baselines for Code Summarisation Evaluation cites this paper.

Simple and Effective Baselines for Code Summarisation Evaluation Style Over Substance: Evaluation Biases for Large Language Models

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-07T14:19:18.862174Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-07T14:19:18.862174Z digest=sha256:daa66f5dfdeefd84f9bc35158c20eb342d5d55acfbaec8aa5e446a480643467c

Observation a0f77b89-09ea-410d-b8ea-7fcf46ffa3bc · inbound

Towards Efficient and Effective Alignment of Large Language Models cites this paper.

Towards Efficient and Effective Alignment of Large Language Models Style Over Substance: Evaluation Biases for Large Language Models

Reference 190

Resolution
unresolved
no resolver link, observed 2026-08-07T04:55:43.107652Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T04:55:43.107652Z digest=sha256:a6549f372be03e137bd6087d71ba466cb0b5596dc80ac69f0818f26dfce5e2e2

Observation f8c77f3b-3746-4371-abd6-e3bb2c761ef8 · inbound

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities cites this paper.

Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities Style Over Substance: Evaluation Biases for Large Language Models

Reference 1992

Resolution
unresolved
no resolver link, observed 2026-08-06T16:34:25.242829Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T16:34:25.242829Z digest=sha256:016aa4ab4b3f81be00ad751215c298f46bbd4ea5a6300266e640e58c798b81c6

Observation 5b2b1bf0-7fb1-4fc5-a63d-3b1c6b8b978f · inbound

Who Endorsed It? Measuring Authority Bias Across Expertise Levels in Language Models cites this paper.

Who Endorsed It? Measuring Authority Bias Across Expertise Levels in Language Models Style Over Substance: Evaluation Biases for Large Language Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-03T09:37:09.585094Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-03T09:37:09.585094Z digest=sha256:0e236e1f75c1d584a6c8a22effc4d95643e6df721bca4cd96a053fe2ac72a4e1

Observation 4271f0a9-1cf1-433c-a4c1-24d5bd6fe217 · inbound

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures cites this paper.

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures Style Over Substance: Evaluation Biases for Large Language Models

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-11T00:35:52.649999Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-05-10T18:25:53.037936Z digest=sha256:a16ef67e7cc476fb808480371fcf315c7c357cb328f3c5f18364a3945ed1f541

Observation 35faa975-e561-4925-9c3c-ab85a65e667d · inbound

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures cites this paper.

IatroBench: Pre-Registered Evidence of Iatrogenic Harm from AI Safety Measures Style Over Substance: Evaluation Biases for Large Language Models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-07-13T00:19:33.861692Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-07-13T00:19:33.861692Z digest=sha256:90df124c5c7e019b6751a543dce298fe00e36ef1ae756c677f916b5cf19f74e9

Observation 4b64db33-a99a-4bdc-bbed-472a9f4b3bce · inbound

Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines cites this paper.

Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines Style Over Substance: Evaluation Biases for Large Language Models

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-11T20:41:14.156272Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=pdf_text observed=2026-05-08T08:14:18.535385Z digest=sha256:cc88ff3803064c384fe00b141dfc3b78f6ca00d415f68c124ccf9424c8eacdf7

Observation a2eea7dd-311f-454c-946d-ebb8a963edd1 · inbound

PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs cites this paper.

PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs Style Over Substance: Evaluation Biases for Large Language Models

Reference 37

Resolution
verified exact
arxiv_id, observed 2026-05-11T15:51:42.468260Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.

source=arxiv_source observed=2026-05-09T19:09:07.557773Z digest=sha256:3dd8a7a0c55220207ea3408c9be5d2af7e1ec25ea6c7f4e9d463fbfb74d32901