{"as_of":"2026-08-11T03:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d9cdbe6e92e304e7805b24f5e1a8ded1fc29073fdeb99a4355da5e5b2dd51544","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:11:32.239612Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.19743/citation-record","integrity":"/paper/2505.19743/integrity","json":"/paper/2505.19743/citation-record.json","paper":"/paper/2505.19743"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:34.535002Z","title":"Llama 3 model card","venue":null,"work_id":"46e1b46a-5101-4d4c-a5df-1069b3e69f0a","year":2024},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:30.023831Z"},"links":{"citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:6a21f4a4d25ea79d2105e00acf3f728a6be0df7b98099c2ecee961de8e37799a","observation_id":"6d6a5bcf-1410-499e-9bee-80e9ba2d008d","resolution":{"observed_at":"2026-08-07T14:11:34.576056Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-07-06T18:00:30.424554Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-07T14:11:30.354244Z","title":"[Anwar et al., 2024] Usman Anwar, Abulhair Saparov, Javier Rando, Daniel Paleka, Miles Turpin, Peter Hase, Ekdeep Singh Lubana, Erik Jenner, Stephen Casper, Oliver Sourbut, et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:30.354244Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:8e8ebe76841b713dbd4b29395b788d3dbed751fc1a2c484cdd3ea8c318b9aff0","observation_id":"6604e4c7-4876-4fbf-a6c5-4753b52ba655","resolution":{"observed_at":"2026-08-07T14:11:30.354244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:34.270264Z","title":"A general theo- retical paradigm to understand learning from human pref- erences","venue":null,"work_id":"48c4c020-af2e-4398-8df1-82ea9889ade5","year":2024},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:30.460144Z"},"links":{"citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:e59379ccff8a219f13d4296f2417fbaec51be3f7f2418a579eb96e2af3434941","observation_id":"897d858c-ec8d-4902-a479-ad3454ca6d16","resolution":{"observed_at":"2026-08-07T14:11:34.317720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T14:11:30.529078Z","title":"Training a helpful and harmless assistant with reinforce- ment learning from human feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:30.529078Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:46fef9860da460265be6926ae26684e3294387c9262994ce989ee74e695c6fc7","observation_id":"04fc6024-8a07-4f7e-bf80-f3e477e26742","resolution":{"observed_at":"2026-08-07T14:11:30.529078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09662","last_updated":"2023-08-30T10:21:00Z","snapshot_observed_at":"2026-08-06T17:01:00.147032Z","submitted_at":"2023-08-18T16:27:04Z","title":"Red-Teaming Large Language Models using Chain of Utterances for Safety-Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09662","snapshot_observed_at":"2026-08-07T14:11:30.658985Z","title":"Red-teaming large language models using chain of utterances for safety-alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:30.658985Z"},"links":{"cited_paper":"/paper/2308.09662","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:7be9454ea8e0bd56117a64fbf8b3cb4391f7c389de2ccd41888c23c29f905301","observation_id":"1d45dbd4-4bca-4e1b-ba73-570d344eedba","resolution":{"observed_at":"2026-08-07T14:11:30.658985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:33.999977Z","title":"Safe rlhf: Safe reinforcement learning from human feedback","venue":null,"work_id":"0bd1261f-e51f-4c73-b5a9-c01a5d79c6a7","year":2024},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:30.727696Z"},"links":{"citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:e2a3d132b5dde127db6999680b9df64bf7b3a54e7b4ff7484c2f14cbd1f089a3","observation_id":"855cb21f-ee1f-4a9c-a45b-59058a3e097e","resolution":{"observed_at":"2026-08-07T14:11:34.082016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:33.889022Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":"06bb9580-0d74-4c9f-b0ab-05142f8d4ffb","year":2023},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:30.792879Z"},"links":{"citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:a2c7e45235f971ad4b50eb9a9b4d28cf61b85cac39cb702000ba9bd43ea2c8de","observation_id":"589885e6-e3ec-489e-9626-de2308e31c5a","resolution":{"observed_at":"2026-08-07T14:11:33.938139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09244","last_updated":"2024-08-16T23:59:29Z","snapshot_observed_at":"2026-08-06T16:36:51.551387Z","submitted_at":"2023-12-14T18:59:04Z","title":"Helping or Herding? Reward Model Ensembles Mitigate but do not Eliminate Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09244","snapshot_observed_at":"2026-08-07T14:11:30.866015Z","title":"Helping or herding? re- ward model ensembles mitigate but do not eliminate re- ward hacking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:30.866015Z"},"links":{"cited_paper":"/paper/2312.09244","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:4c113ea2b1ce21755cd074a13cde56f770aee4ad8709a7cc0b724b43b0b9e9b9","observation_id":"39000e2c-02cc-43e3-bb45-c39de069dde3","resolution":{"observed_at":"2026-08-07T14:11:30.866015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:30.936931Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:30.936931Z"},"links":{"citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:0d1dab3cd922c4fac15a8559fbc41f2cb986439d815f9852cffdab9dc63d50a3","observation_id":"ae7fcb4f-528c-4d01-ac0c-f6371d9b54c0","resolution":{"observed_at":"2026-08-07T14:11:30.936931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15513","last_updated":"2025-06-14T16:04:31Z","snapshot_observed_at":"2026-08-11T01:11:30.234504Z","submitted_at":"2024-06-20T18:37:36Z","title":"PKU-SafeRLHF: Towards Multi-Level Safety Alignment for LLMs with Human Preference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15513","snapshot_observed_at":"2026-08-07T14:11:31.054317Z","title":"Pku-saferlhf: Towards multi-level safety alignment for llms with human preference","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:31.054317Z"},"links":{"cited_paper":"/paper/2406.15513","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:f787ad117b59cecd712aea5831dcd99f07883624f2a3a54d73d7c3e762303fbf","observation_id":"5f05f867-ff0e-4065-8f01-bf7651d187a3","resolution":{"observed_at":"2026-08-07T14:11:31.054317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T14:11:31.096508Z","title":"Mistral 7b","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:31.096508Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:ca9d8186113c03046a9514dfe1f07b37604ec6a5bfe28f2914f349ac27e2e5e6","observation_id":"1bdf83ab-21be-4bb7-9887-959928d07895","resolution":{"observed_at":"2026-08-07T14:11:31.096508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:33.737058Z","title":"Dynamic context selection for document-level neural machine translation via rein- forcement learning","venue":null,"work_id":"2ec64653-b028-4270-a0e8-60442fbaefbf","year":2020},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:31.182001Z"},"links":{"citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:3da18c71a86cc5f1ab5fde8c529e300eed2d99e1a9dad9e54546886e3fe333c6","observation_id":"a0ebabd2-5a2f-4c99-8920-e91a99b028b2","resolution":{"observed_at":"2026-08-07T14:11:33.797114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:33.616099Z","title":"Rain: Your language mod- els can align themselves without finetuning","venue":null,"work_id":"586cc910-c118-4aeb-b882-5a7f26737fce","year":2024},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:31.302812Z"},"links":{"citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:e1ccbfa94c7bc096d64a2926d76a90dbb13f0b27198e7291ecfc0554e05a4829","observation_id":"67459871-29de-46ae-ba2d-8d2545b9a780","resolution":{"observed_at":"2026-08-07T14:11:33.657948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-07T14:11:31.354337Z","title":"Webgpt: Browser-assisted question-answering with human feedback","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:31.354337Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:637127965cb775c833e8719661ad5dbc4ccc33e58c814a49b5638097820d1966","observation_id":"a56194f8-74ef-4bd5-94c0-b158a810ad1d","resolution":{"observed_at":"2026-08-07T14:11:31.354337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:33.272910Z","title":"Discovering language model behaviors with model-written evaluations","venue":null,"work_id":"1bcc992e-350b-4182-a89e-60b7e8f9fb6c","year":2023},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:31.458213Z"},"links":{"citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:3ce9f40143756441fc75ca8723317494ae507c6b4ae1c873c851411b4d072c3b","observation_id":"91c21b9c-92ec-44b9-8eef-10ea4e1495ee","resolution":{"observed_at":"2026-08-07T14:11:33.356856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12358","last_updated":"2024-08-12T21:13:35Z","snapshot_observed_at":"2026-07-06T18:02:19.428801Z","submitted_at":"2024-04-18T17:37:02Z","title":"From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12358","snapshot_observed_at":"2026-08-07T14:11:31.507646Z","title":"From r to q∗: Your lan- guage model is secretly a q-function","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:31.507646Z"},"links":{"cited_paper":"/paper/2404.12358","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:69318a79acc4f7aae7d4919137a73e818b609b4eefc8365f4e8fdab6d8b28885","observation_id":"50bee4c0-563f-436b-b0f4-554b9e7a3a4d","resolution":{"observed_at":"2026-08-07T14:11:31.507646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05802","last_updated":"2022-06-14T01:16:24Z","snapshot_observed_at":"2026-07-06T13:19:58.934755Z","submitted_at":"2022-06-12T17:40:53Z","title":"Self-critiquing models for assisting human evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.05802","snapshot_observed_at":"2026-08-07T14:11:31.546765Z","title":"Self-critiquing models for assisting human eval- uators","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:31.546765Z"},"links":{"cited_paper":"/paper/2206.05802","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:0e9c9ad9d76526c0e0fb32e99eab0ede89b84b9a4daef6627194c727bd6273c7","observation_id":"0a52bf91-962a-46af-be21-be10800abe81","resolution":{"observed_at":"2026-08-07T14:11:31.546765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:33.086007Z","title":"Learning to summarize with human feedback","venue":null,"work_id":"75460226-f65c-48f9-af2f-b170dace1958","year":2020},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:31.604763Z"},"links":{"citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:e13b5f7600769adf3fc22640fe2d8d8c65c6b78d53a0014322a526ca76a0d6b3","observation_id":"aafe33f8-6e17-4fca-a305-083e30e4be93","resolution":{"observed_at":"2026-08-07T14:11:33.180261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T14:11:31.652819Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:31.652819Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:ffd54c13363194da16e2823a264b648551918236c8435ea06a3822d3dc69cca3","observation_id":"56fc202a-a8ae-4449-9161-221c8110495a","resolution":{"observed_at":"2026-08-07T14:11:31.652819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-05T13:59:17.004288Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-07T14:11:31.734703Z","title":"Beyond reverse kl: Gen- eralizing direct preference optimization with diverse diver- gence constraints","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:31.734703Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:10725a73926d4be2fdd357f56a74d350983325b75101f3b0e3751c19cad20eb9","observation_id":"fe761636-83cd-4a26-a6ab-06a340bb0116","resolution":{"observed_at":"2026-08-07T14:11:31.734703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12966","last_updated":"2023-07-24T17:44:58Z","snapshot_observed_at":"2026-07-06T15:57:57.167169Z","submitted_at":"2023-07-24T17:44:58Z","title":"Aligning Large Language Models with Human: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12966","snapshot_observed_at":"2026-08-07T14:11:31.809976Z","title":"Aligning large lan- guage models with human: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:31.809976Z"},"links":{"cited_paper":"/paper/2307.12966","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:d1cc439bceb86ff0294843101546fed83ea26e2461af1c3cfb7f4cdc3f3fbf75","observation_id":"821655a1-b7eb-4960-af6c-5269549aa457","resolution":{"observed_at":"2026-08-07T14:11:31.809976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10862","last_updated":"2021-09-27T21:12:49Z","snapshot_observed_at":"2026-08-04T13:56:39.444746Z","submitted_at":"2021-09-22T17:34:18Z","title":"Recursively Summarizing Books with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.10862","snapshot_observed_at":"2026-08-07T14:11:31.886088Z","title":"Recursively summarizing books with human feed- back","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:31.886088Z"},"links":{"cited_paper":"/paper/2109.10862","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:6364e24fa36778c53e7b019653cf35742f5ad270dbd240e473c4fa019cd43e8e","observation_id":"77e94b15-2a06-4775-8896-7597012b38aa","resolution":{"observed_at":"2026-08-07T14:11:31.886088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.05302","last_updated":"2023-10-07T07:01:26Z","snapshot_observed_at":"2026-08-09T04:25:12.977504Z","submitted_at":"2023-04-11T15:53:40Z","title":"RRHF: Rank Responses to Align Language Models with Human Feedback without tears","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.05302","snapshot_observed_at":"2026-08-07T14:11:31.958446Z","title":"Rrhf: Rank responses to align language models with human feedback without tears","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:31.958446Z"},"links":{"cited_paper":"/paper/2304.05302","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:8d89c9540e7cebff9cad5c04b5370d8f92bf11264793bad48f883d115af2e91d","observation_id":"f6cd4066-6ef3-448c-a30e-c0710270a619","resolution":{"observed_at":"2026-08-07T14:11:31.958446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:32.886099Z","title":"Token- level direct preference optimization","venue":null,"work_id":"0393814a-79b0-49c8-878e-d9bb6032433c","year":2024},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:32.063041Z"},"links":{"citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:98181bf2bb4b6d75773865cb56b4c458a35523c0d5276030eb6a0dcb04f1ddfb","observation_id":"dbd60d84-94dd-4028-8a95-c4afe65da5e0","resolution":{"observed_at":"2026-08-07T14:11:32.992025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:32.720193Z","title":"Llamafactory: Unified efficient fine- tuning of 100+ language models","venue":null,"work_id":"a379b824-0f0d-42b8-8c82-c755cf2bd4cc","year":2024},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:32.151558Z"},"links":{"citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:4d51ed9b629b3912d5ec1da968b48006c38bb91466827563ffb4543f4a430461","observation_id":"f7819f66-1b75-41c9-ad78-34db3d3a57bc","resolution":{"observed_at":"2026-08-07T14:11:32.808085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-07T14:11:32.199965Z","title":"[Zhong et al., 2024] Han Zhong, Guhao Feng, Wei Xiong, Li Zhao, Di He, Jiang Bian, and Liwei Wang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:32.199965Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:93f6410aefefe7672a2ce15924ab3c2e0eaf92eda968f86aa4312d6c1849f9c4","observation_id":"c4de7e60-b185-4ffc-a5e9-0029ea61649a","resolution":{"observed_at":"2026-08-07T14:11:32.199965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T14:11:32.239612Z","title":"Fine-tuning lan- guage models from human preferences","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:32.239612Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:aba39d812616674ab3bd3cbbb34f09c81b4f435aa479152426b6879d3c86959e","observation_id":"7b4deacb-e750-4ada-bfad-fd7e36233812","resolution":{"observed_at":"2026-08-07T14:11:32.239612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-07-06T16:13:07.384791Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-07T14:11:31.238165Z","title":"Rlaif: Scaling reinforcement learning from human feedback with ai feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:31.238165Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:8da2722cc8f3bf0c27609e9a4458903716f7982b7850683dbbf2ed8ff7ea61d6","observation_id":"65db4843-36f3-4006-a46d-b49cd14deb8a","resolution":{"observed_at":"2026-08-07T14:11:31.238165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:33.457997Z","title":"Training language models to follow instruc- tions with human feedback","venue":null,"work_id":"94c3cf5b-146f-4be6-8aaa-e5a3bdefcf4e","year":2022},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:31.412944Z"},"links":{"citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:955c13b00c25343e0860876f6f021c382769c418a336f3bb8b04a651a195f6b2","observation_id":"11622fac-69f3-4709-a420-7de135f080eb","resolution":{"observed_at":"2026-08-07T14:11:33.510976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-07T14:11:30.606796Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:30.606796Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:cb88e1efcb68487aae8bf71a84348202df0f2d60570a24f99d576bd735c62a8e","observation_id":"7300e744-7910-476a-b0be-1e611f510e7c","resolution":{"observed_at":"2026-08-07T14:11:30.606796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:34.155060Z","title":"Ultrafeedback: Boosting language models with high-quality feedback","venue":null,"work_id":"7348d07f-d53f-46a3-81d4-95e9675caf1d","year":2023},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:30.699799Z"},"links":{"citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:09d613f0587b88ac45cd42d7f5e9eda957cae1708566aadf69b9f5b648e55dac","observation_id":"05331e07-6d4b-44e5-a284-a84a0b92d6de","resolution":{"observed_at":"2026-08-07T14:11:34.197255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:11:34.402279Z","title":"aligner/aligner-7b-v1.0 · Hug- ging Face — huggingface.co","venue":null,"work_id":"d4a80e3f-bb76-4f52-80e7-e78a636289e4","year":2024},"citing_paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:11:30.227734Z"},"links":{"citing_paper":"/paper/2505.19743"},"observation_digest":"sha256:21a7d482e2999e10a8fcf7c92a0ef61bde0c595eb358ed8da3898da9f93914d3","observation_id":"b4213521-25c1-4121-b9e0-0c12ca520057","resolution":{"observed_at":"2026-08-07T14:11:34.468851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19743","last_updated":"2025-08-16T11:40:47Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T04:25:32.618058Z","submitted_at":"2025-05-26T09:24:36Z","title":"Token-level Accept or Reject: A Micro Alignment Approach for Large Language Models"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 0 inbound Pith citation observations for arXiv:2505.19743."}