{"as_of":"2026-08-14T16:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d17624502a6069ce321b1d648dd140564a05c518f8567c24094fa631a79aed51","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:41:59.898754Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.07434/citation-record","integrity":"/paper/2506.07434/integrity","json":"/paper/2506.07434/citation-record.json","paper":"/paper/2506.07434"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T05:41:59.723254Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.723254Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:61edfc09467ca9275833c7a72d6eb4ef99bd6adac991b6d40b30c0c75f474e06","observation_id":"f42454d5-f4d2-4ceb-ad89-ed16655ecc5b","resolution":{"observed_at":"2026-08-07T05:41:59.723254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T05:41:59.728663Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.728663Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:1ae37d9422f4df6566422e194f404741c3876775c4b131d6c401c0087cf23c5b","observation_id":"f2d04461-63eb-4683-b39b-d4ff39bc5ba2","resolution":{"observed_at":"2026-08-07T05:41:59.728663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.733623Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.733623Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:29fbb53fb448814bee5872e0c994ec2f25c564cd15b98442c39ecd86d41311d7","observation_id":"e2454226-aa40-439d-94cf-58f199d91b95","resolution":{"observed_at":"2026-08-07T05:41:59.733623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T05:41:59.738804Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.738804Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:bfe9fa92bab98d484bcaa116f32011b698868c0aca70a69bd1b955f3bb16a67c","observation_id":"6eab885f-f233-43d4-8214-d026879de2c8","resolution":{"observed_at":"2026-08-07T05:41:59.738804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:00.425327Z","title":null,"venue":null,"work_id":"cb0daaaf-0484-45a1-8d3c-f60c57990441","year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.743661Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:132193c27849f58ca943dd1798409c0adaf8a1c71bb6ebd2127d81ab1610828d","observation_id":"6c126313-59e3-46f2-898b-59f623c5335b","resolution":{"observed_at":"2026-08-07T05:42:00.429903Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.748520Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.748520Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:465ffc2f15e78bad46656b80d7760083d9f3141405df34ee46c9b14d3fcd5e68","observation_id":"e263492c-a53e-4a19-8da9-d8a058e9ebe8","resolution":{"observed_at":"2026-08-07T05:41:59.748520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:41:59.754141Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.754141Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:fe769abbd5bb00ae0e9ff4904742eabebd609f1c7abfeb9caa0223bd47ff35e3","observation_id":"69929be8-2c5d-4f29-a7f4-a1d5c50a16da","resolution":{"observed_at":"2026-08-07T05:41:59.754141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02795","last_updated":"2024-10-31T05:39:06Z","snapshot_observed_at":"2026-08-12T22:51:27.012951Z","submitted_at":"2024-09-04T15:11:55Z","title":"Towards a Unified View of Preference Learning for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02795","snapshot_observed_at":"2026-08-07T05:41:59.758542Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.758542Z"},"links":{"cited_paper":"/paper/2409.02795","citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:fe10fccb7b8462e3166e26fb1c336cb5608520358a6b11cba0e713d384d3d3ad","observation_id":"d1c48dca-cb8a-40da-979e-57de75e1eca0","resolution":{"observed_at":"2026-08-07T05:41:59.758542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T05:41:59.763408Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.763408Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:76a4b2abb870bd6698a5e432b8cf6480d5dbcaec93013f8314edd8722be60dc5","observation_id":"e4aa96fc-ea8e-414f-b248-0a220dd2f454","resolution":{"observed_at":"2026-08-07T05:41:59.763408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.768395Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.768395Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:8699f2503633830c667b78b2deb43e5237f26f50d5ba5cc9b3c20672e815f903","observation_id":"bf14a360-c7d7-4ca5-8200-7361abb00d9a","resolution":{"observed_at":"2026-08-07T05:41:59.768395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:00.410496Z","title":null,"venue":null,"work_id":"9c4e07fb-f6bb-4ae3-a56d-22c2e4bc93ea","year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.773306Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:af34c0f1fbcd7ba08a6dba512a5f333c000f3eef7dfb0e29154683a39d30e89d","observation_id":"dcf37842-a86b-4865-9d2e-62087eda24fa","resolution":{"observed_at":"2026-08-07T05:42:00.414961Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:00.395026Z","title":null,"venue":null,"work_id":"3cb2a99b-8f41-4693-bd81-fc81778b343b","year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.779254Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:1acbe35aa75fd651e16f320a2283788546efba1a3c00e357c1e470ee9bd06ba7","observation_id":"728195e0-4188-42a7-836a-cbd81a21e6c0","resolution":{"observed_at":"2026-08-07T05:42:00.399434Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.783935Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.783935Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:33488adc3ee2678d927502c85a6673a97d7484c1bcd0ebb3c9533d4d44fcf2d5","observation_id":"ae38a833-d89b-4e7b-966f-acd3521c1e16","resolution":{"observed_at":"2026-08-07T05:41:59.783935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.788661Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.788661Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:d934cb675ab306fc8a5a55dd91b673886bf08b26103becb8165e1a2e983084ef","observation_id":"26d64d00-ed8d-4e16-a975-c5d840efa41c","resolution":{"observed_at":"2026-08-07T05:41:59.788661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.793457Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.793457Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:af3f8c57ddf6c3319cc2ce411403e00c3b10d0225648dc52fe2a724747994566","observation_id":"ea847371-9676-4b68-b5cc-1bb76b531e33","resolution":{"observed_at":"2026-08-07T05:41:59.793457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16306","last_updated":"2025-08-03T22:12:55Z","snapshot_observed_at":"2026-08-12T23:36:29.543366Z","submitted_at":"2024-06-24T04:08:35Z","title":"Cascade Reward Sampling for Efficient Decoding-Time Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16306","snapshot_observed_at":"2026-08-07T05:41:59.798320Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.798320Z"},"links":{"cited_paper":"/paper/2406.16306","citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:9517274e926c87dabf82d68261274c1b4019847571e4385e7d14c5bfe71d184b","observation_id":"b0ca6ada-dfb6-47b6-8910-fc9d13ec4de4","resolution":{"observed_at":"2026-08-07T05:41:59.798320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-11T09:34:38.920981Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-07T05:41:59.803056Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.803056Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:6dcf14ea640b53bce04ad7d5a530451dcdcbc5f256d21c2cdeae9241d28f8837","observation_id":"ddb1f633-567c-4dda-b123-7a64809bc191","resolution":{"observed_at":"2026-08-07T05:41:59.803056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.807985Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.807985Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:4776233389c01172b65918244dea1ad02a4d01fc8c8221f27fdb291445475547","observation_id":"2f06e1fb-6d84-4874-9fae-94f8a8f16659","resolution":{"observed_at":"2026-08-07T05:41:59.807985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:00.338649Z","title":null,"venue":null,"work_id":"4c8c160f-05b6-4d1c-9df3-f4bd87d876e7","year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.812559Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:3a8c640a702f498320b7aaf8aba9ac1fedfc26c427d6e947bb7b808da6889f11","observation_id":"04d88e52-dcd1-4a23-a4db-dbe687d393af","resolution":{"observed_at":"2026-08-07T05:42:00.343664Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:00.322183Z","title":null,"venue":null,"work_id":"4acc7bd4-de79-4ba6-a429-23dbc7460a66","year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.817521Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:f239089c3a9c206e5d7313d623ab9d033c33ba562f6b0b495337c0e6cfc92fdb","observation_id":"3c235bbf-c136-439c-8880-3a62de372171","resolution":{"observed_at":"2026-08-07T05:42:00.327360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.822198Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.822198Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:5a98762a129c7d29ffd5de38c81627bb00953aa2e54cf8b27f4043347582d661","observation_id":"b619c84c-ea22-4f36-88f2-510e374b9de2","resolution":{"observed_at":"2026-08-07T05:41:59.822198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-08-13T15:15:10.681693Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18451","snapshot_observed_at":"2026-08-07T05:41:59.826898Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.826898Z"},"links":{"cited_paper":"/paper/2410.18451","citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:5a797dc2920a09708732c3a0e45d2f2ee16568cd0106e01a8291632cb4d318ab","observation_id":"00cfa11b-6d35-4e7e-b128-ccc94a2bde9c","resolution":{"observed_at":"2026-08-07T05:41:59.826898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.831536Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.831536Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:03b4aa1bcb1278d6fc05d6b9fde98a5c8d0291b78a5cbf7c68de22e15e81fa50","observation_id":"da3a15be-3b24-40f3-b24f-ff7ad75c4025","resolution":{"observed_at":"2026-08-07T05:41:59.831536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07672","last_updated":"2025-03-02T06:25:14Z","snapshot_observed_at":"2026-08-12T22:26:35.483941Z","submitted_at":"2024-10-10T07:29:35Z","title":"MACPO: Weak-to-Strong Alignment via Multi-Agent Contrastive Preference Optimization","version":2},"cited_work":{"arxiv_id":"2410.07672","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.07672","snapshot_observed_at":"2026-08-07T05:42:00.027393Z","title":"MACPO: Weak-to-Strong Alignment via Multi-Agent Contrastive Preference Optimization","venue":"cs.CL","work_id":"04370814-2e79-45ba-98b0-fa2f843c1d96","year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.836155Z"},"links":{"cited_paper":"/paper/2410.07672","citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:28e17f2fe44f55f848818f9502fdc608d03045a39eb41dba4a533921ab2cfc2a","observation_id":"10244946-515c-4eac-8887-dbf5191fb7c2","resolution":{"observed_at":"2026-08-07T05:42:00.035197Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.841106Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.841106Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:ce53a71583be862150c276f93c030086509846c454b18773b114af6cb883fe1f","observation_id":"6afa6bf8-e9d3-4407-b26d-c19045ce25ef","resolution":{"observed_at":"2026-08-07T05:41:59.841106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:00.287376Z","title":null,"venue":null,"work_id":"aa686c84-ed30-4530-80e6-f038e9deda9e","year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.845773Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:360511f12ea3a15bc7d82ee7a9fb9e0a69927794b394d5ac8253394cce3e54f5","observation_id":"70609451-2c99-4a11-ada2-fca543dd2f80","resolution":{"observed_at":"2026-08-07T05:42:00.291938Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.850453Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.850453Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:464140b521f92ab8121a3be0e20099e96dbcdf0476de6d74bd86ede35e97aa72","observation_id":"5375d0f2-0ab7-45de-a8a9-108c59f968fc","resolution":{"observed_at":"2026-08-07T05:41:59.850453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.855461Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.855461Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:e01de4b1da69f2722029429cc64a66471519f8ca15a0e4c689bcd2ef944e569a","observation_id":"98d78969-e2bd-4620-bd8a-ea940cc3af37","resolution":{"observed_at":"2026-08-07T05:41:59.855461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:00.251613Z","title":null,"venue":null,"work_id":"6c23a572-e215-4dbe-85d6-20be26a81ac8","year":2025},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.859681Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:5344dd686e95050dc9205b4be23975fee64b0c314cfa994b06a135cca8ff1113","observation_id":"a32203e1-f232-4ca3-9054-d26c33800a0b","resolution":{"observed_at":"2026-08-07T05:42:00.256598Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:42:00.234701Z","title":null,"venue":null,"work_id":"71e744c5-abde-426e-88fb-44ebc4267305","year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.864330Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:1944d1e19c95e8aa1068529f5a9737ed9261f85fb20dbe77a23639aaef8f29fb","observation_id":"50457d42-c2c4-4bdf-9aec-af5d02db6c69","resolution":{"observed_at":"2026-08-07T05:42:00.240191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12845","last_updated":"2024-06-18T17:58:28Z","snapshot_observed_at":"2026-08-12T23:39:50.330661Z","submitted_at":"2024-06-18T17:58:28Z","title":"Interpretable Preferences via Multi-Objective Reward Modeling and Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12845","snapshot_observed_at":"2026-08-07T05:41:59.868635Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.868635Z"},"links":{"cited_paper":"/paper/2406.12845","citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:1aa2efd2b377c3e589bee2dc75ed614f5bc123fc6efc9e9994e030481b87c827","observation_id":"875c2e27-052c-4e7f-bbbd-d4b8646455d2","resolution":{"observed_at":"2026-08-07T05:41:59.868635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01257","last_updated":"2025-03-06T12:13:14Z","snapshot_observed_at":"2026-08-14T09:29:31.135575Z","submitted_at":"2024-10-02T06:05:52Z","title":"HelpSteer2-Preference: Complementing Ratings with Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01257","snapshot_observed_at":"2026-08-07T05:41:59.874401Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.874401Z"},"links":{"cited_paper":"/paper/2410.01257","citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:a89f3589ba54561ebf2e4970e90b0dd51f8d09e0d308ece4860044fce5b9bfb0","observation_id":"38ed5144-7e39-40df-b130-03924ff07c98","resolution":{"observed_at":"2026-08-07T05:41:59.874401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.879020Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.879020Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:1a79fb245fa61410c574cd4ca49b53b9b4e271576db5c04217e99b0d56bcea50","observation_id":"9b1f624a-b78e-40e0-92a9-ae8961a70220","resolution":{"observed_at":"2026-08-07T05:41:59.879020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.883540Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.883540Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:935a3deed54588838567cf525e0781e0a6bfbc55e600083e7e4e50bdb2961813","observation_id":"25a722e3-a79e-495b-b7cf-4b0ae3582c2b","resolution":{"observed_at":"2026-08-07T05:41:59.883540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.888508Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.888508Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:4becff49ffb1c70183c6265b522ecd53afcb82550e466ef82a6554ef460522cd","observation_id":"022ed38c-2672-427e-b021-93c840d06276","resolution":{"observed_at":"2026-08-07T05:41:59.888508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.893439Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.893439Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:52863bacb7fe90207fc7feef664dde75c818943ace98699c44650c8d47b4498d","observation_id":"770a7858-670d-4cbb-ba78-232a78c0282e","resolution":{"observed_at":"2026-08-07T05:41:59.893439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:41:59.898754Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T05:41:59.898754Z"},"links":{"citing_paper":"/paper/2506.07434"},"observation_digest":"sha256:59a5d6f2183452b45cdee23d97126e02ab83993def729ab9473f93abba14d60c","observation_id":"002ea223-2ba5-45dc-8dfe-98b998b3b746","resolution":{"observed_at":"2026-08-07T05:41:59.898754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07434","last_updated":"2025-06-09T05:21:22Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T21:49:15.530339Z","submitted_at":"2025-06-09T05:21:22Z","title":"Well Begun is Half Done: Low-resource Preference Alignment by Weak-to-Strong Decoding"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 0 inbound Pith citation observations for arXiv:2506.07434."}