{"as_of":"2026-08-11T09:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f7f42e9f1c97f1d8ba6a9a38bd43c5e6067b6c4bc04036ab725ee79edd241f2c","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:33:49.407438Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T09:50:02.986120Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13927","snapshot_observed_at":"2026-08-04T09:50:02.986120Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.13434","last_updated":"2026-07-28T12:08:40Z","snapshot_observed_at":"2026-08-08T01:32:59.519778Z","submitted_at":"2025-10-15T11:30:49Z","title":"$M^2PO$: Multi-Perspective Multi-Pair Preference Optimization for Machine Translation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T09:50:02.986120Z"},"links":{"cited_paper":"/paper/2501.13927","citing_paper":"/paper/2510.13434"},"observation_digest":"sha256:8fcdeb9944278ae3e0512921e406a73b9517f6b553baa43d47e754e3518ba49b","observation_id":"976a655d-ee16-4605-9b09-749733efc3ba","resolution":{"observed_at":"2026-08-04T09:50:02.986120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.13927/citation-record","integrity":"/paper/2501.13927/integrity","json":"/paper/2501.13927/citation-record.json","paper":"/paper/2501.13927"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:33:49.255433Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.255433Z"},"links":{"citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:68594505154861f8a5af3e1b44fe02e00ad349ee819a0f89cd1b6d9dc90e9feb","observation_id":"a8ffed35-4df1-4562-92b8-5750e3fb43a5","resolution":{"observed_at":"2026-08-10T15:33:49.255433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:33:49.260423Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.260423Z"},"links":{"citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:56f6eb774d457cea01bb76ae198d12254ed4f0dbdef1f19a3c353d040ffa4497","observation_id":"48386289-5891-4c04-a528-225988a52510","resolution":{"observed_at":"2026-08-10T15:33:49.260423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T15:33:49.265602Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.265602Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:9a421dc2b82ac66e44152de29b1565344fffa3e056298038f3f617f3b2f71543","observation_id":"d7faed29-0373-4ed1-b849-896e283a75a1","resolution":{"observed_at":"2026-08-10T15:33:49.265602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:33:49.909912Z","title":null,"venue":null,"work_id":"a046d8c0-c9d1-4066-a4af-5973cef7d845","year":2023},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.270479Z"},"links":{"citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:66d0bc012d0add099961a6ddd5ae3bbf7d855d4d4da0d82b115e0ab072c454e9","observation_id":"18ccb24b-85fa-43d1-9cc3-7bc1131a32a6","resolution":{"observed_at":"2026-08-10T15:33:49.914338Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:33:49.275257Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.275257Z"},"links":{"citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:7dd936831d58198680a71bee9e02ce4db881cb925b3d8afb9e781c8244f565d1","observation_id":"903b21b8-fed5-4355-8a8a-60ee5b1f09d7","resolution":{"observed_at":"2026-08-10T15:33:49.275257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12674","last_updated":"2023-08-24T09:32:29Z","snapshot_observed_at":"2026-08-10T21:54:09.866011Z","submitted_at":"2023-08-24T09:32:29Z","title":"Improving Translation Faithfulness of Large Language Models via Augmenting Instructions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12674","snapshot_observed_at":"2026-08-10T15:33:49.279856Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.279856Z"},"links":{"cited_paper":"/paper/2308.12674","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:556b691f4131ebfee87941c2dc6f80db8439ac839511867c2b5a0291c8486e41","observation_id":"7147301a-f1b8-4853-afd2-968b601954f1","resolution":{"observed_at":"2026-08-10T15:33:49.279856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:33:49.284782Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.284782Z"},"links":{"citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:c42e85dc05624532f1c9ea3709259b298d9e4cc41bf1503eabbeb3bfa3036d46","observation_id":"c40ac948-6627-4185-be7b-f75b6725a955","resolution":{"observed_at":"2026-08-10T15:33:49.284782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-10T15:33:49.289388Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.289388Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:54ae6ba16201f87ea459b46ec1c985ef8a0420079bc1599db483eb50a2db6616","observation_id":"56cea1e8-1d99-4013-80fb-c7137854d150","resolution":{"observed_at":"2026-08-10T15:33:49.289388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T15:33:49.294671Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.294671Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:64a24c1b2161cd6a8e279662aeb6a4885580cf5883ca029d898fe93756169fc3","observation_id":"673bbf53-fb00-465e-80e2-f32d89cbc32b","resolution":{"observed_at":"2026-08-10T15:33:49.294671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10966","last_updated":"2024-03-25T21:30:19Z","snapshot_observed_at":"2026-07-06T16:20:48.868168Z","submitted_at":"2023-09-19T23:39:07Z","title":"MBR and QE Finetuning: Training-time Distillation of the Best and Most Expensive Decoding Methods","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10966","snapshot_observed_at":"2026-08-10T15:33:49.299376Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.299376Z"},"links":{"cited_paper":"/paper/2309.10966","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:33eac0637b175dbd697af68db709c53e71fc1be61137185448151a693f70f58d","observation_id":"00d7cc87-75b3-4134-b301-f3c5c2175161","resolution":{"observed_at":"2026-08-10T15:33:49.299376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:33:49.304535Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.304535Z"},"links":{"citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:5672da346307658e30d6a558475fe73996383e274085ff4d3a050d31b1e733d5","observation_id":"3ee3c649-91ce-4906-a05a-6d19df484e85","resolution":{"observed_at":"2026-08-10T15:33:49.304535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:33:49.867216Z","title":null,"venue":null,"work_id":"0f0e793e-83ba-478a-872d-b66a73da2a89","year":2021},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.308679Z"},"links":{"citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:2d2c1418d690243e99c22575a125dc25727934b5cf841041d06601413dbaab6b","observation_id":"342a3390-2131-4095-a60d-3ba16e96f8f4","resolution":{"observed_at":"2026-08-10T15:33:49.871750Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10482","last_updated":"2023-10-16T15:03:14Z","snapshot_observed_at":"2026-08-10T21:54:08.158256Z","submitted_at":"2023-10-16T15:03:14Z","title":"xCOMET: Transparent Machine Translation Evaluation through Fine-grained Error Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10482","snapshot_observed_at":"2026-08-10T15:33:49.312524Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.312524Z"},"links":{"cited_paper":"/paper/2310.10482","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:5eb2c323a14f9539295d455e22c5196eee7225bcd03b37365259d2535f763795","observation_id":"ccece5cc-aa11-4e5e-b05c-787053af64eb","resolution":{"observed_at":"2026-08-10T15:33:49.312524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-10T15:33:49.316725Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.316725Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:1fcd8784f39d27e9659ea04ddfb4f2dc4b5bd0095116b8ffd96955825064896b","observation_id":"25354d49-4424-4b46-a275-549784784591","resolution":{"observed_at":"2026-08-10T15:33:49.316725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10038","last_updated":"2024-03-30T16:10:47Z","snapshot_observed_at":"2026-08-10T21:54:40.022782Z","submitted_at":"2024-02-15T16:00:58Z","title":"RS-DPO: A Hybrid Rejection Sampling and Direct Preference Optimization Method for Alignment of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10038","snapshot_observed_at":"2026-08-10T15:33:49.320907Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.320907Z"},"links":{"cited_paper":"/paper/2402.10038","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:0b62fa60ba941d9478d881d710d09051956d5e6cc68fac5674c4e59c4855b645","observation_id":"b030da44-4156-4975-8ea3-27b97e079b0a","resolution":{"observed_at":"2026-08-10T15:33:49.320907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06657","last_updated":"2024-01-23T23:16:11Z","snapshot_observed_at":"2026-08-10T21:51:54.603545Z","submitted_at":"2023-09-13T01:07:25Z","title":"Statistical Rejection Sampling Improves Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06657","snapshot_observed_at":"2026-08-10T15:33:49.325078Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.325078Z"},"links":{"cited_paper":"/paper/2309.06657","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:96fa87f34e22248e872d9012c548d058cbc1e9cdd16d98122c1b2fda51868928","observation_id":"0ef3e392-0d32-4c33-b50e-afea7fff831b","resolution":{"observed_at":"2026-08-10T15:33:49.325078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-03T02:02:15.325394Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-10T15:33:49.329189Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.329189Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:739c80f0d66f31247250a15d927f2610ca92572318fa6abd956c411bc22c3523","observation_id":"378b2aeb-276e-4b79-a9fd-fc4fb01b0e8e","resolution":{"observed_at":"2026-08-10T15:33:49.329189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:33:49.853378Z","title":null,"venue":null,"work_id":"18829e78-93b7-49fd-9fd8-cb63c9fe1660","year":2003},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.333286Z"},"links":{"citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:ce56e54b61a412a42fe5614a0d9537cc635949c20fd6134716641d07e8acc74c","observation_id":"0bc56fff-5cea-4d95-aeb3-7806563831f0","resolution":{"observed_at":"2026-08-10T15:33:49.857625Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:33:49.337533Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.337533Z"},"links":{"citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:cd3b41707b0221467b782a2e87371a36122df1936e0971cc0d7b31f8a3ef7069","observation_id":"4787f51a-c92e-43a0-817f-ed4d5fc6c092","resolution":{"observed_at":"2026-08-10T15:33:49.337533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:33:49.341392Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.341392Z"},"links":{"citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:0415903884cd100306c9a7ae9d0e4c3899c3ebc8694a347dc7e0b6e0b7f3eea6","observation_id":"032c8464-e88d-4fa2-9717-574c0e11da19","resolution":{"observed_at":"2026-08-10T15:33:49.341392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11925","last_updated":"2023-09-21T09:38:56Z","snapshot_observed_at":"2026-08-10T21:54:10.550193Z","submitted_at":"2023-09-21T09:38:56Z","title":"Scaling up COMETKIWI: Unbabel-IST 2023 Submission for the Quality Estimation Shared Task","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11925","snapshot_observed_at":"2026-08-10T15:33:49.345414Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.345414Z"},"links":{"cited_paper":"/paper/2309.11925","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:7995152fa45de838ecfbb8278440a120815b794ff723696a287c9c4b57170850","observation_id":"5e7e67ee-ed98-4143-91f5-45c7b93cd32a","resolution":{"observed_at":"2026-08-10T15:33:49.345414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:33:49.349467Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.349467Z"},"links":{"citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:5f21ac9d5d30ce4fb093453ff702c0ff8b8ff6e81ba67ef55f3edaf1dfe2535c","observation_id":"7e81baf6-3ddc-450b-9d16-b1fb1b66beba","resolution":{"observed_at":"2026-08-10T15:33:49.349467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T15:33:49.353390Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.353390Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:1e40610cc02428d46aca502fc405de29e71a1ff4d5bb2b86467ee9fea9706306","observation_id":"9bc59f9c-f8e7-4638-828c-807829f427a7","resolution":{"observed_at":"2026-08-10T15:33:49.353390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09223","last_updated":"2024-11-20T23:06:56Z","snapshot_observed_at":"2026-08-10T21:55:47.925914Z","submitted_at":"2024-05-15T10:04:19Z","title":"Word Alignment as Preference for Machine Translation","version":2},"cited_work":{"arxiv_id":"2405.09223","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.09223","snapshot_observed_at":"2026-08-10T15:33:49.592435Z","title":"Word Alignment as Preference for Machine Translation","venue":"cs.CL","work_id":"5d476988-f25c-46fa-b5a8-01bd140db7e3","year":2024},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.357426Z"},"links":{"cited_paper":"/paper/2405.09223","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:e443c905aca177b34a5a401eba75090027c51f82f68eff71be51f16ada6379c1","observation_id":"e80f9d96-461d-4cba-9ac9-e7f0e13b4f31","resolution":{"observed_at":"2026-08-10T15:33:49.597185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11674","last_updated":"2024-02-06T08:03:27Z","snapshot_observed_at":"2026-08-08T14:40:34.532170Z","submitted_at":"2023-09-20T22:53:15Z","title":"A Paradigm Shift in Machine Translation: Boosting Translation Performance of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11674","snapshot_observed_at":"2026-08-10T15:33:49.361736Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.361736Z"},"links":{"cited_paper":"/paper/2309.11674","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:c2b86d780ff5242f4dd2db2ce877c0d338b45ec0a04902aa07b895c7dfe4f24c","observation_id":"2e510341-9fa2-49cc-a0b7-aaf575e64ef0","resolution":{"observed_at":"2026-08-10T15:33:49.361736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08417","last_updated":"2024-06-03T01:28:06Z","snapshot_observed_at":"2026-08-10T21:54:38.067043Z","submitted_at":"2024-01-16T15:04:51Z","title":"Contrastive Preference Optimization: Pushing the Boundaries of LLM Performance in Machine Translation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08417","snapshot_observed_at":"2026-08-10T15:33:49.365732Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.365732Z"},"links":{"cited_paper":"/paper/2401.08417","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:ac99eace0f90db6c25f98e93b55710497aac1308a0b0b0bc932ed467b657ef49","observation_id":"816f9ad9-58b3-4b10-a62c-eddaf1f39398","resolution":{"observed_at":"2026-08-10T15:33:49.365732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11525","last_updated":"2024-02-27T17:12:38Z","snapshot_observed_at":"2026-08-11T01:37:59.202229Z","submitted_at":"2024-02-18T09:51:49Z","title":"Advancing Translation Preference Modeling with RLHF: A Step Towards Cost-Effective Solution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11525","snapshot_observed_at":"2026-08-10T15:33:49.370301Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.370301Z"},"links":{"cited_paper":"/paper/2402.11525","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:b218fef124e6c664f35399e9fe6ddac65ac4cf9b961e63ae4d3925aa0310e999","observation_id":"09cd69dc-0ae7-44ba-a795-9c84b31e7616","resolution":{"observed_at":"2026-08-10T15:33:49.370301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08380","last_updated":"2024-04-12T14:07:38Z","snapshot_observed_at":"2026-08-10T21:54:40.578686Z","submitted_at":"2023-11-14T18:43:51Z","title":"Direct Preference Optimization for Neural Machine Translation with Minimum Bayes Risk Decoding","version":2},"cited_work":{"arxiv_id":"2311.08380","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.08380","snapshot_observed_at":"2026-08-10T15:33:49.523718Z","title":"Direct Preference Optimization for Neural Machine Translation with Minimum Bayes Risk Decoding","venue":"cs.CL","work_id":"11f76dc0-f907-4cb8-a5c8-e4f60420ffae","year":2023},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.374376Z"},"links":{"cited_paper":"/paper/2311.08380","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:09f7cadc2465a3e03a3afc4b5d80bb9590f7b898231e9817821e8f44bea48f67","observation_id":"265ab3df-03a0-4a62-a1a7-22cac652f7ba","resolution":{"observed_at":"2026-08-10T15:33:49.530136Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18098","last_updated":"2023-11-21T11:01:24Z","snapshot_observed_at":"2026-08-10T21:54:36.042693Z","submitted_at":"2023-05-29T14:07:52Z","title":"BigTranslate: Augmenting Large Language Models with Multilingual Translation Capability over 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18098","snapshot_observed_at":"2026-08-10T15:33:49.378800Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.378800Z"},"links":{"cited_paper":"/paper/2305.18098","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:440be30e8e05e8b09aca3fa387ef3cd25e79c7c66649bcc4c0fd1a95fb443147","observation_id":"8e0a3f63-b791-41a6-a085-9b84cf2e3c99","resolution":{"observed_at":"2026-08-10T15:33:49.378800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:33:49.808711Z","title":null,"venue":null,"work_id":"3200e687-e90a-4b13-bb74-a9ae8b37086a","year":2024},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.383400Z"},"links":{"citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:4b1c1b5db4ec863a8151033b7fa45f9d19e0439b580d64d0fe96d311de4eabd3","observation_id":"202cad37-fdd1-4ff2-8a2d-56d7436f35dc","resolution":{"observed_at":"2026-08-10T15:33:49.812910Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.10968","last_updated":"2023-06-21T11:31:50Z","snapshot_observed_at":"2026-08-09T21:09:11.567435Z","submitted_at":"2023-06-19T14:30:52Z","title":"BayLing: Bridging Cross-lingual Alignment and Instruction Following through Interactive Translation for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.10968","snapshot_observed_at":"2026-08-10T15:33:49.387779Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.387779Z"},"links":{"cited_paper":"/paper/2306.10968","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:bf008eca76183873b62b843722bb4fd34f63dfdd836669e455161876ca20bd4a","observation_id":"44ed6093-aebd-4357-89fb-d7de9e97f291","resolution":{"observed_at":"2026-08-10T15:33:49.387779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-10T10:05:24.083432Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-10T15:33:49.392420Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.392420Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:25c1d34aa1d4c23839b483e909fbfc9e0f83c5982a66781225231d5c3516e957","observation_id":"4f3d6aaa-03ba-48a7-8dcc-31af6a49cd52","resolution":{"observed_at":"2026-08-10T15:33:49.392420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:33:49.794042Z","title":null,"venue":null,"work_id":"5f5e982d-2815-4b9f-b6fb-561f1f14cc13","year":2022},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.397139Z"},"links":{"citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:62f6413eb8e2ecb601f61c1d44ce0a2dc4d6887c5742fdb63d084cd950f3fb3e","observation_id":"f90d9479-0c70-4d0d-8b7f-269f8ec766d4","resolution":{"observed_at":"2026-08-10T15:33:49.798288Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04675","last_updated":"2024-06-14T11:40:52Z","snapshot_observed_at":"2026-08-08T14:38:42.704834Z","submitted_at":"2023-04-10T15:51:30Z","title":"Multilingual Machine Translation with Large Language Models: Empirical Results and Analysis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.04675","snapshot_observed_at":"2026-08-10T15:33:49.401796Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.401796Z"},"links":{"cited_paper":"/paper/2304.04675","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:ad19c284847cb23f646d0a8709c203687b50cb763d000f8f5eefdec2484f0358","observation_id":"c09ae6be-89e6-4bfb-b852-d141e4700c60","resolution":{"observed_at":"2026-08-10T15:33:49.401796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04948","last_updated":"2023-10-09T14:08:40Z","snapshot_observed_at":"2026-08-10T21:54:32.811036Z","submitted_at":"2023-08-09T13:32:06Z","title":"Extrapolating Large Language Models to Non-English by Aligning Languages","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04948","snapshot_observed_at":"2026-08-10T15:33:49.407438Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T15:33:49.407438Z"},"links":{"cited_paper":"/paper/2308.04948","citing_paper":"/paper/2501.13927"},"observation_digest":"sha256:365ba0bb69fde786f14fffc34cb8cc88b841d15f56355a6a5e6f89ed7c5c2365","observation_id":"8ee226b8-839c-4e0d-8f75-1b13ead6f388","resolution":{"observed_at":"2026-08-10T15:33:49.407438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.13927","last_updated":"2025-01-23T18:59:47Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T04:37:25.933057Z","submitted_at":"2025-01-23T18:59:47Z","title":"CRPO: Confidence-Reward Driven Preference Optimization for Machine Translation"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2501.13927."}