{"as_of":"2026-08-11T15:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:371553fa7454be981bae9dd03e911cea2906a4a8278bb61771610e9707e3a802","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:29:08.702803Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.20382/citation-record","integrity":"/paper/2412.20382/integrity","json":"/paper/2412.20382/citation-record.json","paper":"/paper/2412.20382"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.15402","last_updated":"2024-06-06T01:58:54Z","snapshot_observed_at":"2026-07-06T16:24:10.053246Z","submitted_at":"2023-09-27T04:53:10Z","title":"Navigate through Enigmatic Labyrinth A Survey of Chain of Thought Reasoning: Advances, Frontiers and Future","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15402","snapshot_observed_at":"2026-08-10T23:29:08.621228Z","title":"A survey of chain of thought reasoning: Advances, frontiers and future","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.621228Z"},"links":{"cited_paper":"/paper/2309.15402","citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:e6e96260fac2c4b00ca56f18e3a8fd9365e56410301e62cb8dd9b33ff936ad8f","observation_id":"765ec87f-85e9-4544-b8a2-d2a4c4a1cbbc","resolution":{"observed_at":"2026-08-10T23:29:08.621228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08967","last_updated":"2024-12-13T04:44:11Z","snapshot_observed_at":"2026-08-10T22:26:40.697702Z","submitted_at":"2024-01-17T04:43:21Z","title":"ReFT: Reasoning with Reinforced Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08967","snapshot_observed_at":"2026-08-10T23:29:08.643231Z","title":"Reft: Reasoning with reinforced fine-tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.643231Z"},"links":{"cited_paper":"/paper/2401.08967","citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:6309f472ecf34f837f54947495fb9962cecbe13a8c815ddae54fe99b2f3ed8ac","observation_id":"f7d33d71-2741-4062-941e-e7cfbaaba0ef","resolution":{"observed_at":"2026-08-10T23:29:08.643231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T23:29:08.648900Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.648900Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:a071acbe0811c5ab55d3572763f301aa41adaa757af1bd07bd375bde4a78f530","observation_id":"a7cba53f-2d86-49bb-b31a-247e4861d845","resolution":{"observed_at":"2026-08-10T23:29:08.648900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:29:08.915622Z","title":"Reinforcement learning from hu- man feedback research program,","venue":null,"work_id":"84f80ebb-a620-411d-bc61-61a7cbc07276","year":2024},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.652900Z"},"links":{"citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:128ae49cc89c91402dae02e957a7f687e92643256dbdf4996b1f616f86c91f6b","observation_id":"d756caa0-f2fb-4bce-be55-08b9c331a589","resolution":{"observed_at":"2026-08-10T23:29:08.920202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:29:08.903407Z","title":"[Ouyang et al., 2022] Long Ouyang, Jeffrey Wu, Xu Jiang, Diogo Almeida, Carroll Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, et al","venue":null,"work_id":"355faf1c-2718-48b9-a7be-d31ccfcae07e","year":2024},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.657197Z"},"links":{"citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:6a79e79c9a6c9573ae00fdbf39063dc022f4528c7618795e21c1f9b84e575d13","observation_id":"cb228be1-5a26-440a-bedc-15678b933440","resolution":{"observed_at":"2026-08-10T23:29:08.907788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-10T23:29:08.665935Z","title":"Code llama: Open foundation models for code","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.665935Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:a74616f1764b18c6e04b17abe8f5822054e0b4e7af5d863eabe1163b71713ebd","observation_id":"9cb83a03-c228-4c27-b273-504d872285f9","resolution":{"observed_at":"2026-08-10T23:29:08.665935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T23:29:08.670100Z","title":"Prox- imal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.670100Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:8545475a9cedfd923575cb824ed8f76fddb87d747618ee22ee0203cf6f424ab3","observation_id":"8cb1330c-674f-4e8c-be60-59a463d3754c","resolution":{"observed_at":"2026-08-10T23:29:08.670100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:29:08.682348Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.682348Z"},"links":{"citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:5d27f890992bfab5753821676f328bee1c59083d821a905292e517183de557e8","observation_id":"43a126fe-1e80-49d4-80dd-0b96823585d8","resolution":{"observed_at":"2026-08-10T23:29:08.682348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14591","last_updated":"2024-06-06T04:16:54Z","snapshot_observed_at":"2026-08-04T04:22:19.808056Z","submitted_at":"2023-12-22T10:29:43Z","title":"Reasons to Reject? Aligning Language Models with Judgments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14591","snapshot_observed_at":"2026-08-10T23:29:08.686241Z","title":"Reasons to reject? align- ing language models with judgments","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.686241Z"},"links":{"cited_paper":"/paper/2312.14591","citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:f4a7ad34709ebb75cceb34055f8136604bad281b86a2d57e9453f8da21cbaa83","observation_id":"236528a0-cbca-49f0-9a94-92be0bb6102d","resolution":{"observed_at":"2026-08-10T23:29:08.686241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:29:08.869821Z","title":"Deep stable learning for out-of-distribution generalization","venue":null,"work_id":"819b28b8-11eb-48af-9b66-d0631d1a8c61","year":2021},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.690351Z"},"links":{"citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:1d0bcd949303b163e004b231e4f40dc1f0ce32420ed8155c1683b6f8c2edac4a","observation_id":"e760f344-7ed6-400d-a704-02ceab086c57","resolution":{"observed_at":"2026-08-10T23:29:08.874066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18922","last_updated":"2025-05-21T15:34:02Z","snapshot_observed_at":"2026-07-31T18:34:20.947967Z","submitted_at":"2024-04-29T17:58:30Z","title":"DPO Meets PPO: Reinforced Token Optimization for RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18922","snapshot_observed_at":"2026-08-10T23:29:08.694519Z","title":"Dpo meets ppo: Reinforced token optimization for rlhf","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.694519Z"},"links":{"cited_paper":"/paper/2404.18922","citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:0aba9e2cac10e6f4a8ae71f56df96732e462e38b40016ed15d8a443f004fa4a7","observation_id":"6b2af11e-e5ae-4fd5-a7ee-71fae1732d1c","resolution":{"observed_at":"2026-08-10T23:29:08.694519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:29:08.854830Z","title":"Instruction Suppose you are a math expert and you are presented with a math problem, a student’s response, and the correct answer","venue":null,"work_id":"841c344f-e415-4d20-810b-3a492ecb73b7","year":2021},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.698734Z"},"links":{"citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:347febe1f7d79263d12979dd18f8f896c51c267eae71c3781ed56377c53f0c4f","observation_id":"73a0d80f-c045-4e1e-9971-1b50322df307","resolution":{"observed_at":"2026-08-10T23:29:08.860190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:29:08.839605Z","title":", 2020 ]","venue":null,"work_id":"99a270cd-f2f9-4a44-abbe-45c51d902026","year":2020},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.702803Z"},"links":{"citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:264e34619eb30f56929afe1e19a6f8da79e0472e5778efd9352fa901530497b5","observation_id":"06b2d7bd-eca1-4f4c-b314-024e629ef859","resolution":{"observed_at":"2026-08-10T23:29:08.845674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:29:08.890429Z","title":"Trl: Transformer reinforcement learning","venue":null,"work_id":"007c24da-f879-43f8-939f-b148d8096782","year":2020},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.674197Z"},"links":{"citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:88f010ec4e39e8f3083e0215a552d45593e5b4810334b4c18c9b335300f0c981","observation_id":"51943ada-4e93-4881-abce-d2efda78f5f9","resolution":{"observed_at":"2026-08-10T23:29:08.895108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:29:08.928535Z","title":"Decoupled Weight Decay Regularization, January","venue":null,"work_id":"ea7c683a-bb3a-42fd-a752-62a8c5800ab3","year":2019},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.639129Z"},"links":{"citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:5b8ef1b373fcb3e75f3263d86900c46860f46c82f83ffc26cb63da016c7cdd2e","observation_id":"0fcc864f-840d-431f-89a3-d968d2426dcc","resolution":{"observed_at":"2026-08-10T23:29:08.932703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-10T23:29:08.678392Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.678392Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:d744d96ddb67bc64d380e8e3522a9dd42161fa4b11f1681835fa730a9e94df55","observation_id":"e85af41d-ee57-4b22-b92b-5f428ec5cd10","resolution":{"observed_at":"2026-08-10T23:29:08.678392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:29:08.940332Z","title":"Re- search on overfitting of deep learning","venue":null,"work_id":"d7be2eb0-1652-42d3-8415-8298a1120f56","year":2019},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.634971Z"},"links":{"citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:15a530215db22534861030042bff3ea806889c7a401f257d654ae5d07abaca06","observation_id":"80ee5de8-8d9f-444b-aad3-fd1f8015f637","resolution":{"observed_at":"2026-08-10T23:29:08.944445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12358","last_updated":"2024-08-12T21:13:35Z","snapshot_observed_at":"2026-07-06T18:02:19.428801Z","submitted_at":"2024-04-18T17:37:02Z","title":"From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12358","snapshot_observed_at":"2026-08-10T23:29:08.661148Z","title":"From r to q∗: Your lan- guage model is secretly a q-function","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.661148Z"},"links":{"cited_paper":"/paper/2404.12358","citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:eb974aa9053f79725fe4ec59ea1221bf150c31fb2b8e4a67d19ba259bca0a7fb","observation_id":"df902786-94fd-4181-93e2-7b54024678d0","resolution":{"observed_at":"2026-08-10T23:29:08.661148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:29:08.966909Z","title":"Training Verifiers to Solve Math Word Problems, November","venue":null,"work_id":"d3d6803e-4473-4124-b33e-7d5f6bd5f74e","year":2021},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.626224Z"},"links":{"citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:87a4f3d168ea5029a8e6ff9fd7a8d316845e742bc92dfdec661278104a68982b","observation_id":"fa261cbe-17d2-4642-8765-4b43140d3573","resolution":{"observed_at":"2026-08-10T23:29:08.970995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:29:08.953097Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":"2c2646b9-1c93-4b30-ac59-bea4c5f04cef","year":2021},"citing_paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T23:29:08.630732Z"},"links":{"citing_paper":"/paper/2412.20382"},"observation_digest":"sha256:9beb6ba59ab3058a00b6eaccf200ab62e6368d4253ba2cdeb8d04539d8a9f15b","observation_id":"01886710-4719-4d2d-a968-1af17bedb062","resolution":{"observed_at":"2026-08-10T23:29:08.958156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.20382","last_updated":"2024-12-29T07:02:45Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T23:21:21.847559Z","submitted_at":"2024-12-29T07:02:45Z","title":"Natural Language Fine-Tuning"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":10},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2412.20382."}