{"as_of":"2026-08-16T23:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:752df458087f93ae039da7e367236dcf119d0afea13b317ba31c87a6a2b8e625","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T19:59:20.206994Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:59:12.210012Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:48:02.099479Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":"2506.14574","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.14574","snapshot_observed_at":"2026-07-03T10:48:02.099479Z","title":"Tgdpo: Harnessing token-level reward guidance for enhancing direct preference optimization.arXiv preprint arXiv:2506.14574, 2025","venue":null,"work_id":"a58a1359-db58-4acd-8b5d-6af667ddd1b7","year":2025},"citing_paper":{"arxiv_id":"2606.12590","last_updated":"2026-06-10T18:35:36Z","snapshot_observed_at":"2026-08-06T17:35:29.796295Z","submitted_at":"2026-06-10T18:35:36Z","title":"Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-27T09:52:20.508013Z"},"links":{"cited_paper":"/paper/2506.14574","citing_paper":"/paper/2606.12590"},"observation_digest":"sha256:6a267c40eb9f72b0a3aa880707b774cb89726d2271217310adf546c1d062a3e4","observation_id":"84ec1dfe-f34e-4d75-8df3-c366e6e177a6","resolution":{"observed_at":"2026-07-03T10:48:02.101463Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.14574","snapshot_observed_at":"2026-08-11T14:59:12.210012Z","title":"Tgdpo: Harnessing token-level reward guidance for enhancing direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09568","last_updated":"2026-08-10T13:05:38Z","snapshot_observed_at":"2026-08-15T13:46:37.076299Z","submitted_at":"2026-08-10T13:05:38Z","title":"Se-DPO: Self-Evolving Token Credit for Direct Preference Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:12.210012Z"},"links":{"cited_paper":"/paper/2506.14574","citing_paper":"/paper/2608.09568"},"observation_digest":"sha256:79d6b99ec6adeabaa2826d413c45cc23420f7817726e781088eac249965face7","observation_id":"053fcd64-447e-461e-b378-fd25c27137ca","resolution":{"observed_at":"2026-08-11T14:59:12.210012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.14574/citation-record","integrity":"/paper/2506.14574/integrity","json":"/paper/2506.14574/citation-record.json","paper":"/paper/2506.14574"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.662336Z","title":"Hindsight experience replay","venue":null,"work_id":"753e6277-b07a-45a8-a1d1-df51f72a596b","year":2017},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.056903Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:73061d8fc71bd4e8ea5f3e6468f47125a7ac5832ee335b347fb03b8e7c932fb3","observation_id":"3ad100d9-c45f-4638-9378-5ed9748e2569","resolution":{"observed_at":"2026-08-15T19:59:20.665968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.651222Z","title":null,"venue":null,"work_id":"a9869601-8c5a-41b9-9407-17da1ee24594","year":1952},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.061791Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:993d637518148dd4cc34fa5c0f7a8ffdc6e8dc84a07d22f77f252b6e0dd14237","observation_id":"bbd70215-91af-4951-b798-b836fcaee5dd","resolution":{"observed_at":"2026-08-15T19:59:20.655381Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.640652Z","title":"On the weaknesses of reinforcement learning for neural machine translation","venue":null,"work_id":"f5f77134-75fd-4434-888f-d192a468c89b","year":2020},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.066821Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:b04e0fbdac158d0808a7985966280fda713143469bac21db39a603c91a93fb0d","observation_id":"c9fa6ee3-4026-412a-8da2-bd38ac6842fd","resolution":{"observed_at":"2026-08-15T19:59:20.644355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.629709Z","title":"Ultrafeedback: Boosting language models with scaled AI feedback","venue":null,"work_id":"3b585b44-638b-4eab-bed2-7730bdd89fc0","year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.071474Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:e588fd5ddbe86522053727c358b2ec52d78592bb3f5b19306decd8b0ab011efc","observation_id":"78c8d9a9-286d-4134-ad09-942f9483a6d4","resolution":{"observed_at":"2026-08-15T19:59:20.633850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.611252Z","title":"Model alignment as prospect theoretic optimization","venue":null,"work_id":"6e2bdc4b-6059-45c2-8e73-946b9836b5e1","year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.075557Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:e4091fcba20b147fb57d899cfb929338926157bd01667c40935da0174bf7bdfa","observation_id":"44c41176-263a-4e64-8e87-36373369656c","resolution":{"observed_at":"2026-08-15T19:59:20.615533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T19:59:20.079682Z","title":"The L lama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.079682Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:9ac6144c8103300582f1e5028c1d600c1d1f520f9a37c567b948516dac29167a","observation_id":"f0071c97-0b26-4991-92a9-674b2c2c068b","resolution":{"observed_at":"2026-08-15T19:59:20.079682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04792","last_updated":"2024-02-29T20:59:17Z","snapshot_observed_at":"2026-08-16T14:20:38.839188Z","submitted_at":"2024-02-07T12:31:13Z","title":"Direct Language Model Alignment from Online AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04792","snapshot_observed_at":"2026-08-15T19:59:20.083973Z","title":"Direct language model alignment from online AI feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.083973Z"},"links":{"cited_paper":"/paper/2402.04792","citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:8cddac8061bc65c7ffb2b998f9204e3c01da9af819d74c7365bf483633dfeb1b","observation_id":"64b30941-1df2-4f31-a4a2-c9c9e7725f52","resolution":{"observed_at":"2026-08-15T19:59:20.083973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-08-12T12:08:23.520312Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-15T19:59:20.087957Z","title":"Open RLHF : An easy-to-use, scalable and high-performance RLHF framework, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.087957Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:e816ec1bfb46a9f8ca70b300e1e74e8c018dbc5e3a1ef1e5e007a08ca9147de4","observation_id":"8a540d8e-872c-4673-887f-cbc3c8e08264","resolution":{"observed_at":"2026-08-15T19:59:20.087957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.598309Z","title":"A., Choi, Y., and Hajishirzi, H","venue":null,"work_id":"945a5ae6-1bd1-4876-ac99-5f4084598d47","year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.092673Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:c7cb1fe31be2cb1ed7737704152585b9654b1279e7ef984714b2792844c6a92b","observation_id":"6d123037-c166-44dc-b0d0-637531a95bbc","resolution":{"observed_at":"2026-08-15T19:59:20.602280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.587464Z","title":null,"venue":null,"work_id":"b3b56882-4d89-44fd-a3be-050789be92d7","year":2023},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.096570Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:0a75a4463ddac1b13e37cc393da29c28171f3cff17f69723e4b0338541235325","observation_id":"fe5cdfaf-9896-4941-b5d5-01f5ff0bbc9b","resolution":{"observed_at":"2026-08-15T19:59:20.591409Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.573773Z","title":"E., and Stoica, I","venue":null,"work_id":"dced8441-9ac3-40ce-be7e-f09347595972","year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.101212Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:e6c498796619592e51def8ef1ca46f552e242e05ee0ef5b4604fb4ccd6d06f5c","observation_id":"dd0ac76e-306c-4b3b-9352-4790887ba812","resolution":{"observed_at":"2026-08-15T19:59:20.578932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.561213Z","title":null,"venue":null,"work_id":"3acea5a5-d6d7-471f-bfbd-2ea275468271","year":2023},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.105042Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:15c9a89de450c641210ca63d80a73ebf8a51c5aab080d372c5b3b4d4461989ac","observation_id":"7110caa9-8fb5-429d-8bf3-8fa3b2bd4db9","resolution":{"observed_at":"2026-08-15T19:59:20.564851Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.108793Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.108793Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:d070ac662cca277be34cde90be3f0d4454538d66b97a349a7da4ecde1a39ae6d","observation_id":"fe53e676-c947-4b41-82fd-b97fbc51d34f","resolution":{"observed_at":"2026-08-15T19:59:20.108793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.113317Z","title":"Sim PO : Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.113317Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:d5354c8bf693306f285f080a4545ff33a1c398bd7ae526bfc7dcf8eed4716d30","observation_id":"bde593bf-cd05-4d12-950e-4507bc753d8c","resolution":{"observed_at":"2026-08-15T19:59:20.113317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18585","last_updated":"2024-10-24T09:36:13Z","snapshot_observed_at":"2026-08-16T13:06:20.340941Z","submitted_at":"2024-10-24T09:36:13Z","title":"Aligning CodeLLMs with Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18585","snapshot_observed_at":"2026-08-15T19:59:20.116800Z","title":"Aligning code LLM s with direct preference optimization, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.116800Z"},"links":{"cited_paper":"/paper/2410.18585","citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:2e41df541bb4027546c97457403b3808bf73ee9e4641330fe0f5ad9aacbf994b","observation_id":"95a2bf27-688d-492d-84eb-f995dd1303ed","resolution":{"observed_at":"2026-08-15T19:59:20.116800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-16T19:40:28.523700Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T19:59:20.121968Z","title":"GPT -4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.121968Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:160a33bf8be31e39a29b8dee9d56d2936ab6412ab401720d338f47fe2432c485","observation_id":"a2ca7894-93c3-4ac1-8e17-1a2e6d2f3313","resolution":{"observed_at":"2026-08-15T19:59:20.121968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.536498Z","title":"F., Leike, J., and Lowe, R","venue":null,"work_id":"9d9e119f-2270-4e57-beb4-209cc08b475c","year":2022},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.125966Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:1ca5309a0b263039a675daa8b87961997db33ec332181794cc9447f210f0a747","observation_id":"0cc2a536-2fbe-46f6-b235-e98933f2f72b","resolution":{"observed_at":"2026-08-15T19:59:20.540547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00722","last_updated":"2024-11-01T16:36:14Z","snapshot_observed_at":"2026-08-16T13:03:44.489678Z","submitted_at":"2024-11-01T16:36:14Z","title":"Token-level Proximal Policy Optimization for Query Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00722","snapshot_observed_at":"2026-08-15T19:59:20.130052Z","title":"Token-level proximal policy optimization for query generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.130052Z"},"links":{"cited_paper":"/paper/2411.00722","citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:6a23265cf2f8f14e694ec5b90d32f9f6d29bc3f32cf3dec6373e4b9cc39a63d5","observation_id":"6f390981-a170-46a6-9d8c-5abff0cba0ec","resolution":{"observed_at":"2026-08-15T19:59:20.130052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.523900Z","title":"Disentangling length from quality in direct preference optimization","venue":null,"work_id":"8fa0334b-311b-47f5-9706-c9ec62a1c4b8","year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.134128Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:3b36bf51c5ee4f0d9cc85379cb80cbc44c881192977bbd712ebbf87bfdf2ac3e","observation_id":"a5503b1c-4266-461c-b049-1f5c68aa6279","resolution":{"observed_at":"2026-08-15T19:59:20.528127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.511257Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":"d73f489f-588c-4ee9-a896-eb30e2b18cd1","year":2023},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.138652Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:5eec42165f1b81670859aa72efcdbae13ffd7e6778f19e9545197022faf0418a","observation_id":"d429dbc8-4ba8-4243-822c-5e29a3926c03","resolution":{"observed_at":"2026-08-15T19:59:20.515215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.500210Z","title":"From r to q^* : Your language model is secretly a q-function","venue":null,"work_id":"805e2174-9b4b-440a-b82f-746f3e84d565","year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.142800Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:51a4ca72962b476384d8cfe279b749cc92bf5a69bf59750ffa7cce063d2f09b2","observation_id":"cda84a96-082f-4e47-9b10-43126acd6890","resolution":{"observed_at":"2026-08-15T19:59:20.504867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T19:59:20.146238Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.146238Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:348c8c9f60578699480587c62aa0c9489f7888fafe5573e59c28505327c52284","observation_id":"ec904eb3-fa10-4f52-bd62-24135df9f95e","resolution":{"observed_at":"2026-08-15T19:59:20.146238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.485921Z","title":"Earlier tokens contribute more: Learning direct preference optimization from temporal decay perspective","venue":null,"work_id":"ddb53e8c-0829-4af8-b755-f7adc721ac50","year":2025},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.150241Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:da3209f19b2909a916bef319ac761c392c6b54be5582029c6a65d73a1d120b92","observation_id":"d7ef3a5c-3826-4a0a-b3ad-cb6aa5906d36","resolution":{"observed_at":"2026-08-15T19:59:20.491433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.473752Z","title":"V., Kostrikov, I., Su, Y., Yang, S., and Levine, S","venue":null,"work_id":"28fc2a73-2b9a-4af1-88f1-c13cd774b592","year":2023},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.154039Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:74681beacb7befc9ec86b481210e3752d2265b4f8027bd81b4e89d39e9b45bf7","observation_id":"ed1b7731-cd1e-4065-8a89-1e86b47def95","resolution":{"observed_at":"2026-08-15T19:59:20.477722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T19:59:20.157866Z","title":"Gemini: A family of highly capable multimodal models, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.157866Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:5de42474700b79e5e2078b1ec8568caff2bdaa4055e6df95f7d7ca78fc00e6b6","observation_id":"61174b07-3329-4789-bbaf-2071270ecefb","resolution":{"observed_at":"2026-08-15T19:59:20.157866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-15T19:59:20.161900Z","title":"Gemma 2: Improving open language models at a practical size, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.161900Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:1037d361d74756ad19fd68e250ab9272b2243db6a1057996b18a0422088039c0","observation_id":"17b3cf86-684d-4a55-b122-5f7dfc24864e","resolution":{"observed_at":"2026-08-15T19:59:20.161900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.462380Z","title":"D., and Finn, C","venue":null,"work_id":"f32b98c7-43a8-439a-8ec8-3db5ae9ec1c2","year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.165866Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:cc4a11ccbc331ef40e4bb295c38e7fe98f5ae73fb8a6e96ed048e8d948e93da4","observation_id":"b2bf55f2-6097-4376-ae9c-2fba496a0a3d","resolution":{"observed_at":"2026-08-15T19:59:20.466316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.450294Z","title":"Interpretable preferences via multi-objective reward modeling and mixture-of-experts","venue":null,"work_id":"958a8ad9-cb53-4dcb-87f1-7fad8a2ef78b","year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.170856Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:aec39ce3c70b096004ee9f8706a5a7a76e208f58e9ac7aa3f7f847a9e55bad85","observation_id":"bb49bab6-7658-4085-94fe-bbcd71b8728c","resolution":{"observed_at":"2026-08-15T19:59:20.455391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.440163Z","title":"A., Ostendorf, M., and Hajishirzi, H","venue":null,"work_id":"825043a7-8fda-4afd-a395-27eb742cdb63","year":2023},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.174094Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:ff9becae7c2886fb04c84d5e4deb23d486bcfea24719cfaec54c4429266c9291","observation_id":"51e64da4-8ebd-4d91-91a5-c7829650e1d4","resolution":{"observed_at":"2026-08-15T19:59:20.443704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.426906Z","title":"Inverse- Q *: Token level reinforcement learning for aligning large language models without preference data","venue":null,"work_id":"fcb5d59c-eefb-4f4f-9bac-46bb541e4ca6","year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.177603Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:f666689c843e177ecd0c29af6094ce4f1808216c4c61bde1efe9df1397ec9e7e","observation_id":"5102d338-e563-4f37-a5b3-c0f4b54cfe73","resolution":{"observed_at":"2026-08-15T19:59:20.431957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.414171Z","title":"Preference-grounded token-level guidance for language model fine-tuning","venue":null,"work_id":"8edf9939-be3e-480d-b3a8-88fdc7f2c533","year":2023},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.181731Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:3eb8e7cc8fd2a6c81a4d0dc574218a85234c431573efcf152b10b32309c5a7da","observation_id":"ce39aa76-ffb9-4e6f-98a2-3b7aea2c304b","resolution":{"observed_at":"2026-08-15T19:59:20.418301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.403543Z","title":"A dense reward view on aligning text-to-image diffusion with preference","venue":null,"work_id":"5f83c372-3271-46ce-8f22-bebefec14585","year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.185336Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:d32682bee14598964701527c6c003ed1dc84bb665f78a61dba5b83fc6c5a2630","observation_id":"48ac8dcc-c5fb-46f1-afa3-646180f2d26b","resolution":{"observed_at":"2026-08-15T19:59:20.407009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02790","last_updated":"2025-01-06T06:17:56Z","snapshot_observed_at":"2026-08-16T18:24:17.779682Z","submitted_at":"2025-01-06T06:17:56Z","title":"Segmenting Text and Learning Their Rewards for Improved RLHF in Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02790","snapshot_observed_at":"2026-08-15T19:59:20.189439Z","title":"Segmenting text and learning their rewards for improved RLHF in language model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.189439Z"},"links":{"cited_paper":"/paper/2501.02790","citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:911104a60addbcef3db931769f990962259eec4171ef2a6e64f8a8698320ac23","observation_id":"87939929-964a-4e5a-88ea-1058304cd6c7","resolution":{"observed_at":"2026-08-15T19:59:20.189439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.392413Z","title":"Token-level direct preference optimization","venue":null,"work_id":"81075199-01dc-4815-89a2-9a5494f951d3","year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.193487Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:a24f3afe6f142f2a9bd3b1074cc693bfd33d2a8f702e9ead8c6561d3bcfdc2bd","observation_id":"73fd95e3-9db9-4fb9-96f6-ef65d94566d2","resolution":{"observed_at":"2026-08-15T19:59:20.396281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.381581Z","title":"Judging LLM -as-a-judge with MT-Bench and Chatbot Arena","venue":null,"work_id":"8dc4331b-6f97-4f4b-b28d-51decf53276f","year":2023},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.196578Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:53c03f49ed5fa6581af481fc3a9dfb5edc29b12c35bffc2213ef49aaea0e4cee","observation_id":"30e4808d-3d42-4cd7-9e0e-17f50d4987e8","resolution":{"observed_at":"2026-08-15T19:59:20.385309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.369108Z","title":"DPO meets PPO : Reinforced token optimization for RLHF","venue":null,"work_id":"b9b50cac-61b9-4e3e-bfc4-d31d7a20b4c5","year":2024},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.199953Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:ebeb8ec10e7d428d0414dd9c2fb11ca6ea2ee5c78695fa73e4e409e9a78f6340","observation_id":"f48c2fb8-b56e-43e0-8128-5d015c50ee54","resolution":{"observed_at":"2026-08-15T19:59:20.374564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-15T19:59:20.203188Z","title":"M., Stiennon, N., Wu, J., Brown, T","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.203188Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:5f05dddc0f10b9f2de97ec9e6691a14e348bf25e357396d22f782f45115fdad6","observation_id":"5d5d3081-9b40-43e8-8315-b047e71bbd0e","resolution":{"observed_at":"2026-08-15T19:59:20.203188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T19:59:20.206994Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T19:59:20.206994Z"},"links":{"citing_paper":"/paper/2506.14574"},"observation_digest":"sha256:35ca650f95d1436037038780a2fd6b7ed86a7e022a99713350223611420b5ea9","observation_id":"4428b8cf-84ce-460f-9649-6b7264d56101","resolution":{"observed_at":"2026-08-15T19:59:20.206994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.14574","last_updated":"2025-06-17T14:30:06Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-16T12:49:31.772841Z","submitted_at":"2025-06-17T14:30:06Z","title":"TGDPO: Harnessing Token-Level Reward Guidance for Enhancing Direct Preference Optimization"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 2 inbound Pith citation observations for arXiv:2506.14574."}