{"as_of":"2026-08-14T14:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b6f7077adca06bccc59a6d1dd1da1591802643ee7f791c10e4780fb085b4ae5","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T02:23:04.515705Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.03453/citation-record","integrity":"/paper/2607.03453/integrity","json":"/paper/2607.03453/citation-record.json","paper":"/paper/2607.03453"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:028b9637e21cce549109dec976cf0baa80010d20dfbbec594a29c3899eb6fdff","observation_id":"5a74ed6f-69ce-4f4e-a5e3-db2bee7b03cc","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":null,"venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:f4adfb40d5ca26d2635b6f49262bc2edb5b02d2cfbfa2c2ea456273bbdb3820f","observation_id":"dc19e9ab-fd1d-46fe-a0ad-8cc4fba1507e","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:c41952529f8dff8b9b48bb338aeedd7b0120844234199d038f993969831c723f","observation_id":"c8800ae6-2397-4c46-ac03-50f126918545","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"doi: 10.18653/v1/2023.emnlp-main.968","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:f878b339a1defca3bdc2a4511b4f75e32a293ed10f67d9191c2dfcf0cee5fe14","observation_id":"bfca84cb-a071-4e4b-ae54-82470c9e7545","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"Faria and N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:6e564f8f6afc0438cedc0174e3f66d1fe2c76fd88feccba2b9f90d6b0525981c","observation_id":"d0af021b-5d45-479f-b715-8439a842e434","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"Grattafiori, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:231cbef67fa31083f6f64d2fa4cf1d39e6ecf1dd499f1b0a6a02102d76b46f43","observation_id":"aed56b67-0510-41cd-979d-9c2d8b6deeb1","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:9957f3a44c39b300bf5d28f5f8987e74a40a7641ea1043720f19ee0992c9618c","observation_id":"a06d60dd-6d51-4b2d-a31b-eff2a21a7306","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"net/forum?id=QnjfkhrbYK","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:2e5795e658cb772e239b1b638d53a1b9982e1d06560a87a86f35c64759fa3de8","observation_id":"d35d0cf5-0873-4c44-acb0-9449293e588c","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"Khalaf, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:c65cff2f74d167b164e9f2e16416b2ca9dcdbcaded458a0a35414cbd91705989","observation_id":"bab8cc30-f192-45ab-8170-bbd85401a040","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:d2c6ed802e5763c4dddd37a4187374800251d59058e24056ab60375d06d3084d","observation_id":"08ae0c01-cea2-4452-afda-ac733a5a2c7d","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:ba51a6626bf51393515b65ac4551ec7d743353dbdef878b913de544aa987fadc","observation_id":"6ebde266-3c58-4af8-b9f0-7bf5d1044370","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:bd4405c8dc7c7a4106a4ffb72361e8f6460a29644a67908df4557be1cdc0976b","observation_id":"1537785b-0ebd-47fc-b24d-117b7a13c1ff","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"URLhttps://aclanthology.org/2024.emnlp-main.35/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:3daeca786516a722e393e34424d34a263eae2ee839b9ce99e72bfc896f7099f4","observation_id":"016b391d-e63b-48a5-84c4-9acf1a4d1b5a","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"net/forum?id=8p3fu56lKc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:34cc17e3ee8ad61e9d29cf5392354cb98816ac25bf66047a670df300d2fa6cd6","observation_id":"68ef9b86-f3b7-4c6b-b3e2-2f9f7e5c4d29","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11895","last_updated":"2022-09-24T00:43:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-24T00:43:19Z","title":"In-context Learning and Induction Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11895","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"doi: 10.18653/v1/ 2022.emnlp-main.759","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2209.11895","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:a457c0737f57faa3cb13a321f2f481f60c4d40dbbab182ea7b855b0685ec7d08","observation_id":"8ad75384-dc42-4da1-a331-5b10b0308ca7","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"Touvron, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:1e0e7d84dd062c9842d3cd5c6505739c054a4b6048ee15ced5162ee11b8b5932","observation_id":"e38c4755-879b-4ce9-a9d8-2e90a38c2247","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"Tunstall, E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:07057cf43f7d35c35f43c6aa360d954443339f00505d41ee8cad1e329760f130","observation_id":"7abb5149-8922-4aac-8963-aba86097a636","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03156","last_updated":"2025-05-06T04:03:11Z","snapshot_observed_at":"2026-08-07T15:56:09.223459Z","submitted_at":"2025-05-06T04:03:11Z","title":"Soft Best-of-n Sampling for Model Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03156","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2505.03156","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:892b04b104eae42dfe42be615fb1576a56e7f12e227798d4195491f83a888985","observation_id":"9ed9df29-4211-437d-97f5-2d7e42b33539","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:cd7ce8d2c3884df2ae23e2c37d816727e87391bc20f81fbae3ad953a5cf36cac","observation_id":"8bd71a78-f4bb-4376-8f19-7c1b05fc6b36","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02080","last_updated":"2022-07-21T07:44:13Z","snapshot_observed_at":"2026-08-10T22:45:29.185791Z","submitted_at":"2021-11-03T09:12:33Z","title":"An Explanation of In-context Learning as Implicit Bayesian Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02080","snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"doi: 10.18653/v1/2024.findings-emnlp.620","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"cited_paper":"/paper/2111.02080","citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:0a23fc582af4599478d42beb6bea539097213fee9169c1671fde79d7c8d1f432","observation_id":"bd6320cd-b181-435d-9f8f-c679da741b6a","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"Step k:” labels are removed, and the “The answer is:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:4422d08e06f1ffd7ae49fe6d10f7a9fac6200b9e8303f0d7dabd946982ebaf6c","observation_id":"87bf07ae-4dfb-4ffb-96c3-00221038d096","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"It uses a smaller, fine-tuned Mistral-7B-Instruct-v0.2 model to classify whether a response refused or complied with a harmful request","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:522d07980fc71511d2c2fa6aa84b45bcd9760d20fcdcb189f322820ef32c5666","observation_id":"a48941b1-4689-4774-b13b-8745f9828f62","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"At one point, he spent 5 hours each for two consecutive weeks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:86d77d6fbe1b7aa3914744bb071d644bba49ba0d452bfda6aea1709ca1ae73c4","observation_id":"23c6b696-f5cd-4039-9e21-fb85a84469ff","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-12T02:23:04.515705Z","title":"5.1,η= n n+d+1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-12T02:23:04.515705Z"},"links":{"citing_paper":"/paper/2607.03453"},"observation_digest":"sha256:535d2bc0bd51e7784d388e4853bbe37635124614b603af6fbeb5cdc247ff6c10","observation_id":"49e6e79e-15d7-4618-a2db-d178c38e3676","resolution":{"observed_at":"2026-07-12T02:23:04.515705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.03453","last_updated":"2026-07-03T16:10:03Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T22:30:06.815397Z","submitted_at":"2026-07-03T16:10:03Z","title":"Best-of-Better-$N$: Generating Pre-Aligned Responses with In-Context Learning"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2607.03453."}