Pith. sign in

Paper Citation Record · LEDGER

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models

As of 18 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2505.19743.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.19743 v3

Coverage vector

measured 32 of 32 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:11:32.239612Z

measured 32 of 32 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

32 of 32 outbound references displayed

  • verified exact0
  • verified fuzzy13
  • unresolved19
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 6d6a5bcf-1410-499e-9bee-80e9ba2d008d · outbound

This paper cites Llama 3 model card.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Llama 3 model card

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:34.576056Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:11:30.023831Z digest=sha256:982b731e7e25e41f24c137ac9c8529e10663cfe646b58db0e879cca2457440c3

Observation 6604e4c7-4876-4fbf-a6c5-4753b52ba655 · outbound

This paper cites Foundational Challenges in Assuring Alignment and Safety of Large Language Models.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Foundational Challenges in Assuring Alignment and Safety of Large Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:30.354244Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:30.354244Z digest=sha256:5bec3e83f3deadf28a0cf71f2a48c2a1cd8950212739659846919d25fcba038b

Observation 897d858c-ec8d-4902-a479-ad3454ca6d16 · outbound

This paper cites A general theo- retical paradigm to understand learning from human pref- erences.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models A general theo- retical paradigm to understand learning from human pref- erences

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:34.317720Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:11:30.460144Z digest=sha256:b341075fe028d0dac3c49025d00c97ef9a3fcfa95813367165f32dd6b7df7f4f

Observation 04fc6024-8a07-4f7e-bf80-f3e477e26742 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:30.529078Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:30.529078Z digest=sha256:29f03f7ea1452b93b3ce1f670c33f8954cb6c02fb4a065c778aa15d0048f37e9

Observation 1d45dbd4-4bca-4e1b-ba73-570d344eedba · outbound

This paper cites Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:30.658985Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:30.658985Z digest=sha256:8fe7b496e21f41b7ac4b5b4423b4cafe2f4b6a733ba0db5dd0e851e27b597f0d

Observation 855cb21f-ee1f-4a9c-a45b-59058a3e097e · outbound

This paper cites Safe rlhf: Safe reinforcement learning from human feedback.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Safe rlhf: Safe reinforcement learning from human feedback

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:34.082016Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:11:30.727696Z digest=sha256:f4809b37e29ac7c8bdca5ddc642c7a0de9f17a5fba860a56df56fd76f5aa8449

Observation 589885e6-e3ec-489e-9626-de2308e31c5a · outbound

This paper cites Raft: Reward ranked finetuning for generative foundation model alignment.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Raft: Reward ranked finetuning for generative foundation model alignment

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:33.938139Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:11:30.792879Z digest=sha256:db68a20aec472875cbfbb62251d9ee5f2f60cb7b7f289c33d6f027d8777654a0

Observation 39000e2c-02cc-43e3-bb45-c39de069dde3 · outbound

This paper cites Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:30.866015Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:30.866015Z digest=sha256:3e1a2d834e3c3a5043fc252ad39e44059a15df2e8b3386cdcd60270a7d7b76b9

Observation ae7fcb4f-528c-4d01-ac0c-f6371d9b54c0 · outbound

This paper cites Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:30.936931Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:30.936931Z digest=sha256:459353d044aa6ea422cbe0abead3abd56197453bbc3a41d3868876cd17f72f62

Observation 5f05f867-ff0e-4065-8f01-bf7651d187a3 · outbound

This paper cites PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.054317Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.054317Z digest=sha256:b54239d9f1aacf6b280e929a532e98dad79a66c700b2995310612044c79120bc

Observation 1bdf83ab-21be-4bb7-9887-959928d07895 · outbound

This paper cites Mistral 7B.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Mistral 7B

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.096508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.096508Z digest=sha256:519317c627dd378ee0a4a3738adff32be732d6acb2b588006d1d42c6966e60aa

Observation a0ebabd2-5a2f-4c99-8920-e91a99b028b2 · outbound

This paper cites Dynamic context selection for document-level neural machine translation via rein- forcement learning.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Dynamic context selection for document-level neural machine translation via rein- forcement learning

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:33.797114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:11:31.182001Z digest=sha256:6d8356700620e337ecf67a4c49bc960b44d777bba052f271266e9919cee4b29f

Observation 67459871-29de-46ae-ba2d-8d2545b9a780 · outbound

This paper cites Rain: Your language mod- els can align themselves without finetuning.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Rain: Your language mod- els can align themselves without finetuning

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:33.657948Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:11:31.302812Z digest=sha256:c982669ba2b3968c5ead42a0f5f68f18a6dbca000f9e4d16d9f449c9bdcf8670

Observation a56194f8-74ef-4bd5-94c0-b158a810ad1d · outbound

This paper cites WebGPT: Browser-assisted question-answering with human feedback.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models WebGPT: Browser-assisted question-answering with human feedback

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.354337Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.354337Z digest=sha256:a1bf6462f2cf6b2a4347d16b306e88b3497e76abbfb7a14215c9b569ceed0c76

Observation 91c21b9c-92ec-44b9-8eef-10ea4e1495ee · outbound

This paper cites Discovering language model behaviors with model-written evaluations.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Discovering language model behaviors with model-written evaluations

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:33.356856Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:11:31.458213Z digest=sha256:7b6d73ac0415ccecbe1b795f77c5925581a3b13e3325e985c40b9d5ecd487d41

Observation 50bee4c0-563f-436b-b0f4-554b9e7a3a4d · outbound

This paper cites From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.507646Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.507646Z digest=sha256:9c96cdb55c9d5999cc20a2f4f93294b197d28cf4fc83d59485e3f808d940a4a4

Observation 0a52bf91-962a-46af-be21-be10800abe81 · outbound

This paper cites Self-critiquing models for assisting human evaluators.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Self-critiquing models for assisting human evaluators

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.546765Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.546765Z digest=sha256:f3b44038bf75b1bc93d40a95f30ded2fa6dee1e454fb45635c94ac64ff704c5b

Observation aafe33f8-6e17-4fca-a305-083e30e4be93 · outbound

This paper cites Learning to summarize with human feedback.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Learning to summarize with human feedback

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:33.180261Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:11:31.604763Z digest=sha256:fcdba7cdd35acd689071b8adfe9c6efcd91d732b394af32dd4623f6082bccea0

Observation 56fc202a-a8ae-4449-9161-221c8110495a · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.652819Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.652819Z digest=sha256:e44a16c7fde253e176bf1230951e677dc4c071e17e27a50f166abd472015aa2f

Observation fe761636-83cd-4a26-a6ab-06a340bb0116 · outbound

This paper cites Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.734703Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.734703Z digest=sha256:154b06a585eedd1f894a8a621500e5c0afc64d9488a143ecd46d34f6dd69e17e

Observation 821655a1-b7eb-4960-af6c-5269549aa457 · outbound

This paper cites Aligning Large Language Models with Human: A Survey.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Aligning Large Language Models with Human: A Survey

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.809976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.809976Z digest=sha256:eafb774b5f81a2b5f588904e744744503b8f7d6a57959adee67d6cfec3c40adf

Observation 77e94b15-2a06-4775-8896-7597012b38aa · outbound

This paper cites Recursively Summarizing Books with Human Feedback.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Recursively Summarizing Books with Human Feedback

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.886088Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.886088Z digest=sha256:7090d926525d3c3e68101feea017811e30662eaf645fd26db3d3fdcadd0ed49d

Observation f6cd4066-6ef3-448c-a30e-c0710270a619 · outbound

This paper cites RRHF: Rank Responses to Align Language Models with Human Feedback without tears.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models RRHF: Rank Responses to Align Language Models with Human Feedback without tears

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.958446Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.958446Z digest=sha256:f8f6cac75b04cd57bae98402152bfed12d945fdb9744934ffa790841c64e16d6

Observation dbd60d84-94dd-4028-8a95-c4afe65da5e0 · outbound

This paper cites Token- level direct preference optimization.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Token- level direct preference optimization

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:32.992025Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:11:32.063041Z digest=sha256:d8ab811c12a2b32858cb3bd6a06bdd7e1d64380f0efc179142a2ce0cd994b72c

Observation f7819f66-1b75-41c9-ad78-34db3d3a57bc · outbound

This paper cites Llamafactory: Unified efficient fine- tuning of 100+ language models.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Llamafactory: Unified efficient fine- tuning of 100+ language models

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:32.808085Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:11:32.151558Z digest=sha256:1b87ea95bb66506d866b0a5789c1f0e3efdd95d91309af997958c49e07de3310

Observation c4de7e60-b185-4ffc-a5e9-0029ea61649a · outbound

This paper cites DPO Meets PPO: Reinforced Token Optimization for RLHF.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models DPO Meets PPO: Reinforced Token Optimization for RLHF

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:32.199965Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:32.199965Z digest=sha256:86b66999be74fd4368a4cc8f69270d1d471b83dc432de223b941555e081cfeab

Observation 7b4deacb-e750-4ada-bfad-fd7e36233812 · outbound

This paper cites Fine-Tuning Language Models from Human Preferences.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Fine-Tuning Language Models from Human Preferences

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:32.239612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:32.239612Z digest=sha256:0b672b7ebfd1fcb937d46e99032c2a4b3efe2093107790cbe3ce3b816886440c

Observation 65db4843-36f3-4006-a46d-b49cd14deb8a · outbound

This paper cites RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.238165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.238165Z digest=sha256:73be244bf674b76128da8f1956771c80f2174b882a1ea8e3798df4b639b4244d

Observation 11622fac-69f3-4709-a420-7de135f080eb · outbound

This paper cites Training language models to follow instruc- tions with human feedback.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Training language models to follow instruc- tions with human feedback

Reference 2021

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:33.510976Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:11:31.412944Z digest=sha256:d46aed1dd9bd296241912ce5a0580ae658195cdece7a84c53d9a96eefb09c814

Observation 7300e744-7910-476a-b0be-1e611f510e7c · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Constitutional AI: Harmlessness from AI Feedback

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:30.606796Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:30.606796Z digest=sha256:99ae7181f6ff93076eeed634fce15f7f0faee700d2f68b1a3ba7d2c474151122

Observation 05331e07-6d4b-44e5-a284-a84a0b92d6de · outbound

This paper cites Ultrafeedback: Boosting language models with high-quality feedback.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Ultrafeedback: Boosting language models with high-quality feedback

Reference 2023

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:34.197255Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:11:30.699799Z digest=sha256:c3d93ef916246220f4ff909caafb574239086bdb50cb421591285e5a95f0e957

Observation b4213521-25c1-4121-b9e0-0c12ca520057 · outbound

This paper cites aligner/aligner-7b-v1.0 · Hug- ging Face — huggingface.co.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models aligner/aligner-7b-v1.0 · Hug- ging Face — huggingface.co

Reference 2024

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:34.468851Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-08-07T14:11:30.227734Z digest=sha256:a123d8f446a13c659158a8747e891dcfb37a9246da74a65909a0132d59e7b496

Pith citing papers

No inbound Pith citation observations are available.