{"as_of":"2026-08-09T21:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:92a6b72fc95efb01447096d3592869cd441d12bec2d05d2dad7260f89a7b357e","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:14:45.567616Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T10:01:59.503415Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T14:02:39.828118Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"cited_work":{"arxiv_id":"2506.08712","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08712","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ee9b25ff-896e-468b-a14e-fbf846513ad7","year":2025},"citing_paper":{"arxiv_id":"2509.20265","last_updated":"2026-04-29T12:32:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-24T15:52:36Z","title":"Failure Modes of Maximum Entropy RLHF","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-18T14:02:11.084514Z"},"links":{"cited_paper":"/paper/2506.08712","citing_paper":"/paper/2509.20265"},"observation_digest":"sha256:2aa43fa447eee3708a5036d1e1ced233f9b4917db8be50570916812b98a547a3","observation_id":"71ed9b45-e61e-4f44-81eb-d7947419bbf3","resolution":{"observed_at":"2026-05-18T14:02:39.830504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08712","snapshot_observed_at":"2026-08-02T10:01:59.503415Z","title":"S., Yoon, E., Hasegawa-Johnson, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16240","last_updated":"2026-06-26T03:03:15Z","snapshot_observed_at":"2026-08-08T01:20:34.619049Z","submitted_at":"2026-06-26T03:03:15Z","title":"Normalized Rewards for Preference Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T10:01:59.503415Z"},"links":{"cited_paper":"/paper/2506.08712","citing_paper":"/paper/2607.16240"},"observation_digest":"sha256:d9bc5f297f928cb146f2814f03672581eb1a53b95077ad2821090e000ea25415","observation_id":"bf7f5771-d720-4a92-87dc-47e4c6c247e1","resolution":{"observed_at":"2026-08-02T10:01:59.503415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08712/citation-record","integrity":"/paper/2506.08712/integrity","json":"/paper/2506.08712/citation-record.json","paper":"/paper/2506.08712"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.441337Z","title":"Explaining individual predictions when features are dependent: More accurate approximations to shapley values","venue":null,"work_id":"b2e75de7-b20c-4adb-a288-129af7337788","year":2021},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.625861Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:d2ceec50c0e08c096e079a4b053770315b3403bc280fb41cd68861b1c5f8dd67","observation_id":"1792dcec-7e4b-485d-aab6-2652c6154666","resolution":{"observed_at":"2026-08-07T05:14:47.444061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:41.672739Z","title":"Llama 3 model card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.672739Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:5e3fc3b3d923be5f1b4989c002e1897abcda72e0f54769b227d4259000e4acfa","observation_id":"98329f87-3bfb-457c-ba45-3f3c6e1eacf2","resolution":{"observed_at":"2026-08-07T05:14:41.672739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.428455Z","title":"Mitigating reward over-optimization in direct alignment algorithms with adaptive importance sampling, 2025","venue":null,"work_id":"9d062d37-95d9-4849-8ede-af8a155c3d1a","year":2025},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.768753Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:4120b347852345e76abb4169d50897e1c4efd435fb1d68edac4d50a2379b41a5","observation_id":"425b234e-dc88-4f52-914a-71c22079b1b3","resolution":{"observed_at":"2026-08-07T05:14:47.431146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.420847Z","title":"G., Guo, Z","venue":null,"work_id":"1dd06541-2831-4589-8479-1c600bf43ffa","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:41.913775Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:9189b8cc370fdb9c716359041f80007e39f50c1309361bb499c55e31090b2624","observation_id":"1638c1d0-5da9-4405-87c8-ac49348bd144","resolution":{"observed_at":"2026-08-07T05:14:47.423282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:42.023438Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.023438Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:eb4d057379eb5a1581c174474b4dd27be8d6773a6f001ffdf735eb5fea694d0e","observation_id":"24dd7f57-28c4-4fe8-9074-5489596df715","resolution":{"observed_at":"2026-08-07T05:14:42.023438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:42.135215Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.135215Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:6224ffbe947568a3e54fd9a69909d816c16e7cf89b2d102033aa147ba58f5857","observation_id":"fceb882e-572d-44f2-beca-7305daa69a4c","resolution":{"observed_at":"2026-08-07T05:14:42.135215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.413141Z","title":"F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":"dc62e87b-5dac-4e97-81ce-c374e1b21516","year":2017},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.210513Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:0cce52859b145a295c2ca7988e82dd820ce8173101e01f3bb053728b4cf9203f","observation_id":"eeb05f53-2f33-4bc0-b3c9-4eb5bc98e9c0","resolution":{"observed_at":"2026-08-07T05:14:47.415696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.405338Z","title":"Ultrafeedback: Boosting language models with high-quality feedback, 2023","venue":null,"work_id":"d2a629d8-6b5f-4a86-9923-796fad9d1628","year":2023},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.296984Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:ab766ec4ca5f1e963b6301722bed0c5fe35fcffbd83f52538a8a9206eaec0833","observation_id":"95b809b0-5d62-4004-b9d9-101bc6a66065","resolution":{"observed_at":"2026-08-07T05:14:47.408306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:42.398724Z","title":"Enhancing chat language models by scaling high-quality instructional conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.398724Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:313fa680bce3dd8811c754d86a45dd40b5a654e4159027abd78640f7c272dced","observation_id":"7e194a62-4662-4361-ba68-22a6d3f5ea1d","resolution":{"observed_at":"2026-08-07T05:14:42.398724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-07T05:14:42.513413Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.513413Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:2ef1343c2f0fdde04024fdbbb84a441f30b9b0a28faffaaaeafca8c7fd3dbd34","observation_id":"45141898-afe8-484c-8e62-c08716403b3e","resolution":{"observed_at":"2026-08-07T05:14:42.513413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-07T05:14:42.597895Z","title":"Kto: Model alignment as prospect theoretic optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.597895Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:fb2b59cd5cbc9234f4c688c139fe172cb759e5e03bca3d37ebf6ade44b1d4fd1","observation_id":"da680899-0219-4152-ad23-3e93ca90f203","resolution":{"observed_at":"2026-08-07T05:14:42.597895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:42.724379Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.724379Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:184110e2f51cb59e26f447d59dcabd2ce1097a0950959a57dad1012be05764fd","observation_id":"31236e31-6e00-4b39-85ac-7f5232678988","resolution":{"observed_at":"2026-08-07T05:14:42.724379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.392845Z","title":"Beyond imitation: Leveraging fine-grained quality signals for alignment","venue":null,"work_id":"06f6d863-e2cc-4cb7-ae37-4327ad151ac6","year":null},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.807169Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:956e0f5a24194390fa5b1ae7294ca099bc92fdd8aff26dda806bbdccf68efc59","observation_id":"cda1935b-ddae-4a4b-8f78-97fbe109079d","resolution":{"observed_at":"2026-08-07T05:14:47.395535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.384504Z","title":"A probabilistic earley parser as a psycholinguistic model","venue":null,"work_id":"98df7326-3e2a-4286-a643-004832b46d0b","year":2001},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:42.938224Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:876f5649b9e58176861f06f77094a19b23142271d7d9eb54b3dfd708cca007ca","observation_id":"a463a060-2d3c-49a0-b719-d5e49148b80e","resolution":{"observed_at":"2026-08-07T05:14:47.387379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.376686Z","title":"Reference-free monolithic preference optimization with odds ratio","venue":null,"work_id":"60824744-8455-4589-b5d3-c3af4c0710cd","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.033275Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:b507cb970d7db23ac3170c84a4377f2e7894e89768e9e2e92bf8b92d1d394baf","observation_id":"4bfa7d60-0423-4c83-aebd-ddfe0126531f","resolution":{"observed_at":"2026-08-07T05:14:47.379614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.368739Z","title":"and Levy, R","venue":null,"work_id":"d823ec1e-ba5a-48d4-9c1a-b5aa2cf36b25","year":2006},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.126624Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:650d01ed717ba91f9179e80c80af8e0a8719fe939f5defe5262e504200ef59c0","observation_id":"0350f2ed-d3ce-4d3c-830c-19bf1471817b","resolution":{"observed_at":"2026-08-07T05:14:47.371360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T05:14:43.201027Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.201027Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:9ec2673df76dd33c71ba8895b67df63da4f8289e6437ee1615b4165641ca62b4","observation_id":"cc52e0c3-8bb3-4d94-a507-dffcc102d1e6","resolution":{"observed_at":"2026-08-07T05:14:43.201027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-07T05:14:43.248348Z","title":"Step-dpo: Step-wise preference optimization for long-chain reasoning of llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.248348Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:413e6fe3998a89c841b451974935833a369bdcea63d48cf5dcc7da40ae76b315","observation_id":"d19fd706-3403-47a2-ad12-cb865ce56a1b","resolution":{"observed_at":"2026-08-07T05:14:43.248348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.360434Z","title":"E., and Stoica, I","venue":null,"work_id":"d97ccf77-3352-4f97-a675-01b4081edc39","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.330957Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:9df88c66fa6f6c0151120791d974a7507732673e012df24303ad7e94af9b81e3","observation_id":"20b7bea3-d90f-4df8-87b0-84308a90de37","resolution":{"observed_at":"2026-08-07T05:14:47.363481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.352975Z","title":null,"venue":null,"work_id":"481e8932-93e2-41ba-ba61-5872ad52e384","year":2023},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.419011Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:30c39efa012b68ffad593c26dc350f0140a079259d3edad05ed175cbe1553253","observation_id":"4e3df7f6-7a62-4f25-8a5d-58e625bfe14f","resolution":{"observed_at":"2026-08-07T05:14:47.355563Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.344773Z","title":"Not all tokens are what you need for pretraining","venue":null,"work_id":"5afbbd46-cae8-4c22-a07f-d099e213bd09","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.489684Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:0f285f5db017ac3e689d03bfe7ed690c53177b8446faf2a21aa056f2bc7ee550","observation_id":"ebe34097-d2cb-4aaa-8b22-31ada1e6919a","resolution":{"observed_at":"2026-08-07T05:14:47.347856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.337340Z","title":"Provably mitigating overoptimization in RLHF : Your SFT loss is implicitly an adversarial regularizer","venue":null,"work_id":"caff17c6-79aa-457f-b220-f19c0fee7998","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.553587Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:e2d4859157cc45e1fa85f4b0d01c840f81d2711cf710c7e6595748d2cbdcc100","observation_id":"35ed17eb-b8c4-4dc6-a9fe-754b7d2fe017","resolution":{"observed_at":"2026-08-07T05:14:47.340004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:43.624256Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.624256Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:b387a5560f492e0865094cdf6390cb20c006446d170d9ecd4540a5eb12ff1e99","observation_id":"c436c405-a559-4406-a993-cd241f3d01e9","resolution":{"observed_at":"2026-08-07T05:14:43.624256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.324266Z","title":null,"venue":null,"work_id":"367468d3-594b-43c9-93a9-de48ec332950","year":2017},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.698453Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:0ed1bb6d3058ccb4d7ade5d507d1e486474255d0f2ad1c6604edf7637ed7a98c","observation_id":"1adf573f-560b-4750-9223-cce8d4ca61cf","resolution":{"observed_at":"2026-08-07T05:14:47.326955Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.315376Z","title":"Sim PO : Simple preference optimization with a reference-free reward","venue":null,"work_id":"980af936-0ff2-4dba-bc15-1e47efc3a3be","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.768830Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:3dec89a7ac286f99a4e64c9415f919677a0b9f463d0091030404e091ca7ed823","observation_id":"00841d81-e6b7-49be-92af-ad2c92ce077d","resolution":{"observed_at":"2026-08-07T05:14:47.318519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:43.851661Z","title":"and Frank, S","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.851661Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:c87e599d5df5bdbd523ae0a4361f1c447f13bee4e6aa9c510f7566507baedae0","observation_id":"0be6bca5-b5ca-4bc2-8d9a-e9b77595f50f","resolution":{"observed_at":"2026-08-07T05:14:43.851661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.302718Z","title":"F., Leike, J., and Lowe, R","venue":null,"work_id":"cb02bc91-81c9-40be-bcfb-2770e3489514","year":2022},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:43.920632Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:b1c009856f1ef62705b015e97e9335a1bdbdc8abf3be571e39a2a50f4d357f94","observation_id":"c3e0bd5a-75e2-468e-b903-a10285da3a45","resolution":{"observed_at":"2026-08-07T05:14:47.309553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:47.206590Z","title":null,"venue":null,"work_id":"12b438b0-7f85-421a-83fe-8aa540a804f4","year":2017},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.027094Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:76b9d9c279bec81f1599ba58ee6a46a9b4aab2bbf1accbc55fd6d9f4593b803e","observation_id":"2ee4273c-88b4-4a4d-9b2c-3d9c1bf7385f","resolution":{"observed_at":"2026-08-07T05:14:47.262125Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19159","last_updated":"2024-09-09T04:39:31Z","snapshot_observed_at":"2026-08-08T10:19:27.268855Z","submitted_at":"2024-03-28T06:03:47Z","title":"Disentangling Length from Quality in Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19159","snapshot_observed_at":"2026-08-07T05:14:44.113845Z","title":"Disentangling length from quality in direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.113845Z"},"links":{"cited_paper":"/paper/2403.19159","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:80760b0baad293428402d6a1044836f354ffc18f1b35437f062d90f7f933bd73","observation_id":"51e5e0f4-f6c6-48d5-9ce1-3c8eade8b949","resolution":{"observed_at":"2026-08-07T05:14:44.113845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:46.873819Z","title":"B., Finn, C., and Niekum, S","venue":null,"work_id":"0b495698-e333-4c92-800d-c580d8fee2fe","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.195859Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:e5211cf4539078686286d7314fdfc8b130973898315f553448eebe701f4bb3b4","observation_id":"99509864-b239-4a70-b17e-fc59fcc97449","resolution":{"observed_at":"2026-08-07T05:14:47.059754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:46.709918Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":"447f1f12-1de3-463a-bb3f-3b7bbc4bdc88","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.285480Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:c9cccc678414de97fe1b198b0935f249d582087bc0fb634a50346ddcab0e6c2c","observation_id":"97ba12ec-4d95-47d8-8976-42f0e7f567b6","resolution":{"observed_at":"2026-08-07T05:14:46.766693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:46.626253Z","title":null,"venue":null,"work_id":"762c14a2-54b0-4027-9685-23fc605cab94","year":1953},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.371677Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:019edcce79c39ba28bd266e0712828f57aa6b76f024700402a3172683d105d9a","observation_id":"84fcbaca-6bd8-4148-bf89-5d8863154608","resolution":{"observed_at":"2026-08-07T05:14:46.666687Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:44.448597Z","title":"S., and Martin, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.448597Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:5cf271b56bd248d7958b8612b158dd1907b3ea9be132f5c9f88a6136746dac62","observation_id":"58b40bde-26e0-4200-923a-e26b358609f2","resolution":{"observed_at":"2026-08-07T05:14:44.448597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:44.525429Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.525429Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:e01cba13337ecf826914dc0e6ac04138039fb419590b7bf95cbe980060e33531","observation_id":"4cbce2f8-8b15-43d9-93b5-5f33853423d1","resolution":{"observed_at":"2026-08-07T05:14:44.525429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:44.606004Z","title":"Trl: Transformer reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.606004Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:5bea402a046a1a46f2c59d29299085d764e8c04fd7d8cbbd5a1a88f38244b7cc","observation_id":"db5ae8f2-5af7-4907-8de6-8a392005d2f9","resolution":{"observed_at":"2026-08-07T05:14:44.606004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:46.500403Z","title":"V., Murray, K., and Kim, Y","venue":null,"work_id":"dbc2309f-80a6-4ff7-8f5e-3678246bacc1","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.660895Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:2d12bd34aebd6a5179df1bfac4c8de75a94a73be987c71b9b21eafdf57cb1a8d","observation_id":"5991f4c3-c998-4191-811e-7aca3019706c","resolution":{"observed_at":"2026-08-07T05:14:46.544726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:44.737682Z","title":"Selective preference optimization via token-level reward function estimation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.737682Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:9d40329121616809a5e266b337279d88c856877acc4cec8bcdf8ec4beaf845b8","observation_id":"8ad94440-41a3-4cd0-9335-cea3803121d6","resolution":{"observed_at":"2026-08-07T05:14:44.737682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:46.384617Z","title":"S., Hasegawa-Johnson, M","venue":null,"work_id":"c41a7796-3cd0-419f-87b8-9ecb5b8211df","year":null},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.802381Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:fb06243a7f6bd35594a74a5d65166cdee0fe549b81d58befa10d13a9834c3cbf","observation_id":"34656020-91f9-4927-a40e-e1992ba9a49a","resolution":{"observed_at":"2026-08-07T05:14:46.416795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:44.866870Z","title":"S., Eom, S., Han, G., Nam, D., Jo, D., On, K.-W., Hasegawa-Johnson, M., Kim, S., and Yoo, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.866870Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:e7a2d482c4f3988269811b4dd2abcd38bdeacf5b2aa175d878b6d2828e6e5518","observation_id":"d628485e-9912-4853-92ab-417c060d13ae","resolution":{"observed_at":"2026-08-07T05:14:44.866870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02472","last_updated":"2024-01-18T07:27:09Z","snapshot_observed_at":"2026-08-09T11:55:43.093624Z","submitted_at":"2023-03-04T18:06:36Z","title":"ESD: Expected Squared Difference as a Tuning-Free Trainable Calibration Measure","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02472","snapshot_observed_at":"2026-08-07T05:14:44.934080Z","title":"S., Tee, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:44.934080Z"},"links":{"cited_paper":"/paper/2303.02472","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:ed8172fd2d92587fb30680dd8125f922e38feef162f7bf724011141bdc5acb2c","observation_id":"683d2268-77fb-4ccf-95d4-895c8b07727f","resolution":{"observed_at":"2026-08-07T05:14:44.934080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14119","last_updated":"2024-03-31T13:36:54Z","snapshot_observed_at":"2026-08-06T08:53:00.100346Z","submitted_at":"2024-03-21T04:08:29Z","title":"C-TPT: Calibrated Test-Time Prompt Tuning for Vision-Language Models via Text Feature Dispersion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14119","snapshot_observed_at":"2026-08-07T05:14:45.017306Z","title":"S., Yoon, E., Tee, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.017306Z"},"links":{"cited_paper":"/paper/2403.14119","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:0a4c959e97d4471dfe457b03316b2b0787dc02113e04a783b2ae0fc2ae1957cf","observation_id":"a63adae7-2697-41d5-b8ca-70c8752b2ccf","resolution":{"observed_at":"2026-08-07T05:14:45.017306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:45.080901Z","title":"S., Kim, J., and Yoo, C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.080901Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:2a41f6afd1605f95ac90701c134c4c7f6f96354640776dbb65338ec8696e4f04","observation_id":"af5f835a-0a5b-41ae-ad1d-c0f68a006d57","resolution":{"observed_at":"2026-08-07T05:14:45.080901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:46.249737Z","title":"Tpc: Test-time procrustes calibration for diffusion-based human image animation","venue":null,"work_id":"3a2549f0-6a41-4cf3-a79f-2f2980778ec4","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.170101Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:13a565c032cd2c44a5070b0885625f528dd32f5fadf8aa939eed61fd7ed61f5b","observation_id":"77f05230-c189-4624-9aff-b930a294cd2c","resolution":{"observed_at":"2026-08-07T05:14:46.318669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:46.161622Z","title":"RRHF : Rank responses to align language models with human feedback","venue":null,"work_id":"012db0b5-a75c-4ba4-86b7-0633fa000236","year":2023},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.244056Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:2274d1ee6f63e1b4494047d711afd7c6629011ec47809f66fd5c9566d172a93a","observation_id":"bba0a0e7-f868-48a1-bac1-32d45411538f","resolution":{"observed_at":"2026-08-07T05:14:46.199167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:46.029243Z","title":"Token-level direct preference optimization","venue":null,"work_id":"b3fa195f-41c9-482f-b6d1-979c4a751c2d","year":null},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.277916Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:9d4b281fae3a51027f4bc81fc8b76a43030acccf213121691af7820324067fad","observation_id":"1eeb1d21-fd0d-487f-a370-57350e86ea35","resolution":{"observed_at":"2026-08-07T05:14:46.081029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T05:14:45.342641Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.342641Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:3ca4b8c2950a06566cd5cf5bc7ffe83d8988f2eaa9566a75b6ecc779732349c9","observation_id":"1dc57259-667c-4d60-b5b1-f7b8a9949c6b","resolution":{"observed_at":"2026-08-07T05:14:45.342641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:45.422180Z","title":"P., Zhang, H., Gonzalez, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.422180Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:fa568b033452a28ba624a7d2a4775015d8d8c6acd422fd1a671a649483818de4","observation_id":"9e796a6b-07b7-440a-873a-5c8207e6972e","resolution":{"observed_at":"2026-08-07T05:14:45.422180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02685","last_updated":"2024-12-03T18:56:07Z","snapshot_observed_at":"2026-08-07T16:08:13.893412Z","submitted_at":"2024-12-03T18:56:07Z","title":"T-REG: Preference Optimization with Token-Level Reward Regularization","version":1},"cited_work":{"arxiv_id":"2412.02685","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.02685","snapshot_observed_at":"2026-08-07T05:14:45.698229Z","title":"T-REG: Preference Optimization with Token-Level Reward Regularization","venue":"cs.CL","work_id":"a668d5e0-b145-4899-b23c-50e0fb2ea912","year":2024},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.496001Z"},"links":{"cited_paper":"/paper/2412.02685","citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:842312a3f9e20550904e27905611995ad631c9b724ec988cbbde307d0d1f0d2a","observation_id":"2cb49ef8-9c9b-4f85-9bb5-73958cbf26a9","resolution":{"observed_at":"2026-08-07T05:14:45.733451Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:14:45.567616Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T05:14:45.567616Z"},"links":{"citing_paper":"/paper/2506.08712"},"observation_digest":"sha256:15ad73b5a603af06faf83d87acf43a9ca2bf59c7314bc15051ad0b317a7fffb4","observation_id":"a0194a21-5383-4b36-b536-83db9bb9b377","resolution":{"observed_at":"2026-08-07T05:14:45.567616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.08712","last_updated":"2025-06-12T11:44:46Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T11:56:25.107973Z","submitted_at":"2025-06-10T11:54:22Z","title":"ConfPO: Exploiting Policy Model Confidence for Critical Token Selection in Preference Optimization"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 2 inbound Pith citation observations for arXiv:2506.08712."}