Pith. sign in

Paper Citation Record · LEDGER

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models

As of 8 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2505.19743.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2505.19743 v3

Coverage vector

measured 32 of 32 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-07T14:11:32.239612Z

measured 32 of 32 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

32 of 32 outbound references displayed

  • verified exact0
  • verified fuzzy13
  • unresolved19
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 6d6a5bcf-1410-499e-9bee-80e9ba2d008d · outbound

This paper cites Llama 3 model card.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Llama 3 model card

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:34.576056Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:11:30.023831Z digest=sha256:ea970ea04fd6ae1345e0953cce354abbf8ffaaec4d1ed8fea1fd7f1b42975dc2

Observation 6604e4c7-4876-4fbf-a6c5-4753b52ba655 · outbound

This paper cites Foundational Challenges in Assuring Alignment and Safety of Large Language Models.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Foundational Challenges in Assuring Alignment and Safety of Large Language Models

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:30.354244Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:30.354244Z digest=sha256:6b516efcadee30ccfef7ade96f4be082649f0179c0c83d7c220fd3ceedc07818

Observation 897d858c-ec8d-4902-a479-ad3454ca6d16 · outbound

This paper cites A general theo- retical paradigm to understand learning from human pref- erences.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models A general theo- retical paradigm to understand learning from human pref- erences

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:34.317720Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:11:30.460144Z digest=sha256:50256059b80317fc4c909afeac60638c3e98d1d477ae63a057aabb77d640e70b

Observation 04fc6024-8a07-4f7e-bf80-f3e477e26742 · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:30.529078Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:30.529078Z digest=sha256:90b920f8142b01d2009d47c23c98a32a52f09c997c4bbd967f59338dec6c52c5

Observation 1d45dbd4-4bca-4e1b-ba73-570d344eedba · outbound

This paper cites Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:30.658985Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:30.658985Z digest=sha256:411d69c784a5c9986fefdc73fd62650b4e0d5a8e95d2e16caa15f7d5f2897379

Observation 855cb21f-ee1f-4a9c-a45b-59058a3e097e · outbound

This paper cites Safe rlhf: Safe reinforcement learning from human feedback.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Safe rlhf: Safe reinforcement learning from human feedback

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:34.082016Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:11:30.727696Z digest=sha256:46b28ec87a46225e4fc4a0a9d5f1fa23c1bbbe630fac47125a9113b77dd05528

Observation 589885e6-e3ec-489e-9626-de2308e31c5a · outbound

This paper cites Raft: Reward ranked finetuning for generative foundation model alignment.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Raft: Reward ranked finetuning for generative foundation model alignment

Reference 10

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:33.938139Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:11:30.792879Z digest=sha256:5668d292e57fc04cae7ae27dd30c7c41214d954ccecb31e3bf79db0e7f33132a

Observation 39000e2c-02cc-43e3-bb45-c39de069dde3 · outbound

This paper cites Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:30.866015Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:30.866015Z digest=sha256:d9eec70f3cca093f41cbf4b9346f273862a8453425c0c717e7f6a69a6f1371fc

Observation ae7fcb4f-528c-4d01-ac0c-f6371d9b54c0 · outbound

This paper cites Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:30.936931Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:30.936931Z digest=sha256:134c80dc9b6c6c7b3ed4b079f47e1dfe2a6756983493fe007023b0972807e50b

Observation 5f05f867-ff0e-4065-8f01-bf7651d187a3 · outbound

This paper cites PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.054317Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.054317Z digest=sha256:2fdd5f4b80c76009459af07d6930ec324dd0fdb2562ea25f26394984744e53b6

Observation 1bdf83ab-21be-4bb7-9887-959928d07895 · outbound

This paper cites Mistral 7B.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Mistral 7B

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.096508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.096508Z digest=sha256:f06da585f7d5700d801aa8ebca9fffcc35dfe2bae5582a1c33670022938c731e

Observation a0ebabd2-5a2f-4c99-8920-e91a99b028b2 · outbound

This paper cites Dynamic context selection for document-level neural machine translation via rein- forcement learning.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Dynamic context selection for document-level neural machine translation via rein- forcement learning

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:33.797114Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:11:31.182001Z digest=sha256:eb120812c26a52c03371b989f039a9ea4f61635d6380b1b8eb6f1ba02e6115d3

Observation 67459871-29de-46ae-ba2d-8d2545b9a780 · outbound

This paper cites Rain: Your language mod- els can align themselves without finetuning.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Rain: Your language mod- els can align themselves without finetuning

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:33.657948Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:11:31.302812Z digest=sha256:19e63a7973eb262c4157bd4d2b3b7c835b7ed587debf92d5596162fbfce84c4d

Observation a56194f8-74ef-4bd5-94c0-b158a810ad1d · outbound

This paper cites WebGPT: Browser-assisted question-answering with human feedback.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models WebGPT: Browser-assisted question-answering with human feedback

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.354337Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.354337Z digest=sha256:dd8c5437738e771e2402046247f43b082005d475731cc20651eb2103e767bcaa

Observation 91c21b9c-92ec-44b9-8eef-10ea4e1495ee · outbound

This paper cites Discovering language model behaviors with model-written evaluations.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Discovering language model behaviors with model-written evaluations

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:33.356856Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:11:31.458213Z digest=sha256:c3b8de019f5dafbf61a4ea5fc0b721627a09277b8a5ba65364cb9dfe3fa752db

Observation 50bee4c0-563f-436b-b0f4-554b9e7a3a4d · outbound

This paper cites From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.507646Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.507646Z digest=sha256:34c668762c224dfab79de066d11672e059e6eee0ec946276d52570af706b1ec4

Observation 0a52bf91-962a-46af-be21-be10800abe81 · outbound

This paper cites Self-critiquing models for assisting human evaluators.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Self-critiquing models for assisting human evaluators

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.546765Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.546765Z digest=sha256:1cf11495da22644b57b5e03742b0450d2fcd4e513be95a6e590d9925fc7d3c14

Observation aafe33f8-6e17-4fca-a305-083e30e4be93 · outbound

This paper cites Learning to summarize with human feedback.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Learning to summarize with human feedback

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:33.180261Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:11:31.604763Z digest=sha256:9b51b2d0a9953d2ed4988479212271771fa7bf895fe4d0e04a058cbdfecaa069

Observation 56fc202a-a8ae-4449-9161-221c8110495a · outbound

This paper cites Llama 2: Open Foundation and Fine-Tuned Chat Models.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Llama 2: Open Foundation and Fine-Tuned Chat Models

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.652819Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.652819Z digest=sha256:9e54e4aea5e5b1d6858c62ebc20d0050479a3e547c3cde1a3572cd8e20490ae5

Observation fe761636-83cd-4a26-a6ab-06a340bb0116 · outbound

This paper cites Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.734703Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.734703Z digest=sha256:ef5b856096c6e6155ad627b66f99aec49f8ebf8997d97d1c4187a6a42d5d932e

Observation 821655a1-b7eb-4960-af6c-5269549aa457 · outbound

This paper cites Aligning Large Language Models with Human: A Survey.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Aligning Large Language Models with Human: A Survey

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.809976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.809976Z digest=sha256:08b1672f98a7f1ab3c439fc5c54820510100a605936517c9b125b662fb9be89e

Observation 77e94b15-2a06-4775-8896-7597012b38aa · outbound

This paper cites Recursively Summarizing Books with Human Feedback.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Recursively Summarizing Books with Human Feedback

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.886088Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.886088Z digest=sha256:f9e1c129f97676df7fcca54626389d4cbecf1a058882493447ec57ed81602293

Observation f6cd4066-6ef3-448c-a30e-c0710270a619 · outbound

This paper cites RRHF: Rank Responses to Align Language Models with Human Feedback without tears.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models RRHF: Rank Responses to Align Language Models with Human Feedback without tears

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.958446Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.958446Z digest=sha256:66ed7e6b8b58cb2983f21bf5378ac95e19e2897ce1c4094d4cb78227c5f2d876

Observation dbd60d84-94dd-4028-8a95-c4afe65da5e0 · outbound

This paper cites Token- level direct preference optimization.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Token- level direct preference optimization

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:32.992025Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:11:32.063041Z digest=sha256:454f560b41ac02c2e7f4a8994fa7748b04b061613688b94e4f0d308ffe4a639f

Observation f7819f66-1b75-41c9-ad78-34db3d3a57bc · outbound

This paper cites Llamafactory: Unified efficient fine- tuning of 100+ language models.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Llamafactory: Unified efficient fine- tuning of 100+ language models

Reference 30

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:32.808085Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:11:32.151558Z digest=sha256:0b8d9b80c1991122ba8711ff6ddedbbe77f883a5929c986ef7e2006cdfbdacb5

Observation c4de7e60-b185-4ffc-a5e9-0029ea61649a · outbound

This paper cites DPO Meets PPO: Reinforced Token Optimization for RLHF.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models DPO Meets PPO: Reinforced Token Optimization for RLHF

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:32.199965Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:32.199965Z digest=sha256:0c78af117911c19ebbb3ef2d6a914bbb179a6e72a10d192123d9b08a99a29fe8

Observation 7b4deacb-e750-4ada-bfad-fd7e36233812 · outbound

This paper cites Fine-Tuning Language Models from Human Preferences.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Fine-Tuning Language Models from Human Preferences

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:32.239612Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:32.239612Z digest=sha256:06c2d66b09d0640e130a3d489b59c0da26983a8a715487070f1395fa6b9f2d95

Observation 65db4843-36f3-4006-a46d-b49cd14deb8a · outbound

This paper cites RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback

Reference 2020

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:31.238165Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:31.238165Z digest=sha256:46460a583d9b2b1290a3104682a9de0770756b542e19168cc8f19b857394f5e3

Observation 11622fac-69f3-4709-a420-7de135f080eb · outbound

This paper cites Training language models to follow instruc- tions with human feedback.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Training language models to follow instruc- tions with human feedback

Reference 2021

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:33.510976Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:11:31.412944Z digest=sha256:39e5c2707cf4f6d9db5b933906cf7e940633a6bbf371ec8b1a305d823911616a

Observation 7300e744-7910-476a-b0be-1e611f510e7c · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Constitutional AI: Harmlessness from AI Feedback

Reference 2022

Resolution
unresolved
no resolver link, observed 2026-08-07T14:11:30.606796Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:11:30.606796Z digest=sha256:ea29a6505ae81463a5f978c798848870bac112bc2ddadeaae74b673f8e001ff8

Observation 05331e07-6d4b-44e5-a284-a84a0b92d6de · outbound

This paper cites Ultrafeedback: Boosting language models with high-quality feedback.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models Ultrafeedback: Boosting language models with high-quality feedback

Reference 2023

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:34.197255Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:11:30.699799Z digest=sha256:4e2717d756077e5efb1746b967697beb38b96a9eae5979c402add01a304585b7

Observation b4213521-25c1-4121-b9e0-0c12ca520057 · outbound

This paper cites aligner/aligner-7b-v1.0 · Hug- ging Face — huggingface.co.

Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models aligner/aligner-7b-v1.0 · Hug- ging Face — huggingface.co

Reference 2024

Resolution
verified fuzzy
raw_fallback, observed 2026-08-07T14:11:34.468851Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-07T14:11:30.227734Z digest=sha256:cbfecea0d3ecd3075f38b5613b73a33cbdd31cf3f86158b29ac61a147ea0d910

Pith citing papers

No inbound Pith citation observations are available.