Pith. sign in

Paper Citation Record · LEDGER

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models

As of 18 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 1 inbound Pith citation observation for arXiv:2506.11110.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.11110 v1

Coverage vector

measured 27 of 27 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T05:48:18.762671Z

measured 28 of 28 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-19T17:49:01.198956Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-19T17:52:43.078608Z

Reference resolution

27 of 27 outbound references displayed

  • verified exact1
  • verified fuzzy4
  • unresolved22
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation ca8b12ba-acf4-4680-97e9-4b44f66a4dde · outbound

This paper cites an unresolved cited work.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Unresolved cited work

Reference 1

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:48:19.145616Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T05:48:18.674740Z digest=sha256:95dcc9ffad26f1469b951893007f2e9d5cf91f6864aacda5b620ebed05f1ff97

Observation a8801b79-71de-4efb-8102-d2978f32e8e6 · outbound

This paper cites On the Opportunities and Risks of Foundation Models.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models On the Opportunities and Risks of Foundation Models

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.679496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.679496Z digest=sha256:c2706083fa042c95d32089590583e5171cf47ce7b543c6259d6a16d26fac043b

Observation ecb9b38d-20a2-44e3-bcb3-9c35e283c271 · outbound

This paper cites an unresolved cited work.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Unresolved cited work

Reference 3

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:48:19.136887Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T05:48:18.683603Z digest=sha256:e4a395877208c4a12a88320384ddf6801b3b225193f8b48c4a445b7645cb4c5c

Observation 22e083f8-5051-4f3b-aa9e-db05d3809bee · outbound

This paper cites Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.687477Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.687477Z digest=sha256:3ff0f9224709b8adf20d84944c6a55f5da74dfa6cbbb7458786dd7ea383a0f84

Observation 6b2f8c53-b099-458e-a10e-bf6182cea7cb · outbound

This paper cites N., Agarwal, A.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models N., Agarwal, A

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.691190Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.691190Z digest=sha256:68e1a847c00455eb4fa6b6782644705b0375fd982bab728c5817ce2337d0cc26

Observation db6f8624-e4bd-4c88-9df9-582ee930b5ed · outbound

This paper cites M., & Daw, N.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models M., & Daw, N

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:48:19.127987Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T05:48:18.694315Z digest=sha256:614826e2fbba9034216aa14b8932fc0be4d88b2201709be2a207816c60876053

Observation 9ddfbf91-19f2-4714-bbdc-235b33366262 · outbound

This paper cites (2025, April 30).

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models (2025, April 30)

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:48:19.119230Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T05:48:18.697755Z digest=sha256:d86b1fd82674b2c3213e01a6eb08a47a2ed5c74f8c06b2c0493ab182b524b9eb

Observation b39862d8-ce43-47f7-844f-957846d06e8f · outbound

This paper cites an unresolved cited work.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:48:19.110513Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T05:48:18.700779Z digest=sha256:9adf8cb15425914dd2e82018e5e16d6b61dbc07eb451b77b364a54be16ef827d

Observation e730bfc6-e3a6-4a94-ab32-a95e4216e086 · outbound

This paper cites Risks from Learned Optimization in Advanced Machine Learning Systems.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Risks from Learned Optimization in Advanced Machine Learning Systems

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.703719Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.703719Z digest=sha256:809072713119b803381fd70a0037090af1baad437eeed19f5cdc6a0be9401eb6

Observation 4a69ce99-64f9-4aea-8806-6bc031bb9582 · outbound

This paper cites J., Madotto, A., & Fung, P.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models J., Madotto, A., & Fung, P

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.707257Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.707257Z digest=sha256:52bdaa60d3ceb3c8d679d9a581022a0bcd14663a558dd0b811af9a62f24ae3da

Observation 8f402b56-e2e0-4ef0-bfd4-d525c25fa11a · outbound

This paper cites Language Models (Mostly) Know What They Know.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Language Models (Mostly) Know What They Know

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.710373Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.710373Z digest=sha256:a369d38987efc0d2d59ed1b0330a3f9e1c09d9169a52ac138027bc9b0be20488

Observation b81764dd-ef14-4a02-be18-39d51fb5d48b · outbound

This paper cites an unresolved cited work.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:48:19.100206Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T05:48:18.713713Z digest=sha256:683e03e7c9064cdeec40d4f3f4e3741f851a3a8a9af952d638ee2cd142a34b37

Observation 2e5dd03d-1075-4823-9f36-5942d21527f2 · outbound

This paper cites An Extensive Evaluation of Factual Consistency in Large Language Models for Data-to-Text Generation.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models An Extensive Evaluation of Factual Consistency in Large Language Models for Data-to-Text Generation

Reference 13

Resolution
verified exact
local_arxiv, observed 2026-08-07T05:48:18.954423Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T05:48:18.717088Z digest=sha256:c11726493555af69906fa08c95439f93c365f407cacd471139ea1df44840ce42

Observation 3c3a3762-9a4b-42d2-b847-2a4f0e3c7fa0 · outbound

This paper cites Self-Refine: Iterative Refinement with Self-Feedback.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Self-Refine: Iterative Refinement with Self-Feedback

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.720267Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.720267Z digest=sha256:f0088189cd8b0a25f254d88e7d8d6fc7ac3f4908b3cdab422e9a7ec247c669e6

Observation 3f14e3bd-1841-425e-87f1-78a2aecff5c8 · outbound

This paper cites (2025, January 28).

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models (2025, January 28)

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:48:19.091152Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T05:48:18.723677Z digest=sha256:ce561b87c1315104d6cd7471a4b2fc4ee2958e5e3514eaee46433b3cf572e287

Observation 0f12f923-b83b-4644-85fa-769ee9358583 · outbound

This paper cites an unresolved cited work.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Unresolved cited work

Reference 16

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:48:19.082051Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T05:48:18.726713Z digest=sha256:9e509d7bd0b3054cd802dc4d02a449d0946863cb19b24eedba68781a158e55a5

Observation 909b254f-98bd-4f5a-aee7-6d0d9ecd945d · outbound

This paper cites GPT-4 Technical Report.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models GPT-4 Technical Report

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.729834Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.729834Z digest=sha256:4e01cb09cd6b0e83b752b2bb45aef9fd39923101beb7c325433bffa88b94f96c

Observation 993b0081-e2ce-4874-8b9c-27e3287e84e8 · outbound

This paper cites & Lowe, R.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models & Lowe, R

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T05:48:19.072558Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T05:48:18.733751Z digest=sha256:5439499935d2516f5b2bf037857d26bc413b293b9d30eb8fdb050df32107484c

Observation 319f121d-f7be-4b3d-bb7c-32c8f7e5aaca · outbound

This paper cites Measuring and Benchmarking Large Language Models' Capabilities to Generate Persuasive Language.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Measuring and Benchmarking Large Language Models' Capabilities to Generate Persuasive Language

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.736717Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.736717Z digest=sha256:12015130b7c4e91538723ea3c6afaec73bd97bf0a62e40776ff5a959b5d7e4ca

Observation 2cdaf0f9-fac2-48fa-a533-58f61e1a17aa · outbound

This paper cites Discovering Language Model Behaviors with Model-Written Evaluations.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Discovering Language Model Behaviors with Model-Written Evaluations

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.740179Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.740179Z digest=sha256:bc17e2104da5879f2aad38882b9f7d539ca8e03a6d314c317fb2e9cabc1e8801

Observation f80abd4b-c4ec-4e6a-a5db-cc57c0a0b564 · outbound

This paper cites Towards Understanding Sycophancy in Language Models.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Towards Understanding Sycophancy in Language Models

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.743441Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.743441Z digest=sha256:93a9a692e4ce0a101f7dfb7cbc6fb769020df308b48a201f1b2a9859eec7663a

Observation f65fc0bd-1523-4229-a7ee-f6471302f18a · outbound

This paper cites Factuality of Large Language Models: A Survey.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Factuality of Large Language Models: A Survey

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.746771Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.746771Z digest=sha256:4baa65bb4d9cd750c11c6a638837331e5eb0c6e7745e1c042039538ee8e4a329

Observation 2d5ce6e7-4f3b-4b59-be71-657dc31564ee · outbound

This paper cites an unresolved cited work.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Unresolved cited work

Reference 23

Resolution
unresolved
raw_fallback, observed 2026-08-07T05:48:19.063567Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T05:48:18.749955Z digest=sha256:dc2854b1e46d3664970bdace695b8a984baba9bc3ff41965bb94b937ec538c18

Observation b0ec885d-1048-4ee7-9218-0abf556dda90 · outbound

This paper cites (2024).OpenFactCheck: A Unified Framework for Factuality Evaluation of LLMs.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models (2024).OpenFactCheck: A Unified Framework for Factuality Evaluation of LLMs

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.752928Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.752928Z digest=sha256:f0a575ee38c1a3bd618c8caabd8ebbc3300721efa33218462bb96b55d65e4042

Observation a67319c4-9aba-48ee-a765-8ba08e47cab0 · outbound

This paper cites Measuring short-form factuality in large language models.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Measuring short-form factuality in large language models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.755967Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.755967Z digest=sha256:57fa07fb181718cbd23eb7c71b8e25880512adf74a1e2fd03cf548dc699c8a1c

Observation db70f714-40be-4af9-9c46-4c8fdccd6114 · outbound

This paper cites Belief Revision: The Adaptability of Large Language Models Reasoning.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models Belief Revision: The Adaptability of Large Language Models Reasoning

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.759340Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.759340Z digest=sha256:64d994e932d2d0dc949d5d0467e0a0a3f838a2fd59ea5ec565721dbb113556e5

Observation a177b9fb-1376-40c8-be69-b7d7ad8c4bb9 · outbound

This paper cites A Survey of Large Language Models.

AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models A Survey of Large Language Models

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T05:48:18.762671Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T05:48:18.762671Z digest=sha256:3f3c1ecdeae4e4748b7719fa59f0e263792466f598a7f45c4eaab442663b2d59

Pith citing papers

Observation c96603d8-3ba7-4d44-86c3-920d4ea43f0a · inbound

Is Agentic AI Ready for Real-World Hardware Engineering? A Deep Dive with Phoenix-bench cites this paper.

Is Agentic AI Ready for Real-World Hardware Engineering? A Deep Dive with Phoenix-bench AssertBench: A Benchmark for Evaluating Self-Assertion in Large Language Models

Reference 15

Resolution
verified exact
arxiv_id, observed 2026-05-19T17:52:43.083675Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-05-19T17:49:01.198956Z digest=sha256:991b8142071923b69a68912472660d897a2dfaa38f2d0b09778b8629a4774c45