{"as_of":"2026-08-23T17:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26f60d179742449f21161d9f0db10d8f597b9e5db43c59c4f27d5fd9f343e928","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:37:30.520795Z","state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:39:40.924883Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T00:39:43.095193Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-20T15:44:54.240920Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"cited_work":{"arxiv_id":"2506.21560","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.21560","snapshot_observed_at":"2026-08-12T00:39:43.095193Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","venue":"cs.CL","work_id":"3ac2c224-f1ac-4f1a-a80a-7508ebff2738","year":2025},"citing_paper":{"arxiv_id":"2608.08010","last_updated":"2026-08-08T08:41:33Z","snapshot_observed_at":"2026-08-17T11:57:29.217049Z","submitted_at":"2026-08-08T08:41:33Z","title":"Ground-Truth Neighborhood Regularization for Reinforcement Learning Post-Training of Time Series Foundation Models","version":1},"reference_index":142,"source":"arxiv_source","source_observed_at":"2026-08-12T00:39:40.924883Z"},"links":{"cited_paper":"/paper/2506.21560","citing_paper":"/paper/2608.08010"},"observation_digest":"sha256:9061b80a68c8814d6722065b05832e3e997354647299c0e792afb8bccd578769","observation_id":"8059ffd7-6d45-4600-a3c4-3192ececd1f8","resolution":{"observed_at":"2026-08-12T00:39:43.100701Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.21560/citation-record","integrity":"/paper/2506.21560/integrity","json":"/paper/2506.21560/citation-record.json","paper":"/paper/2506.21560"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:37:29.512978Z","title":"arXiv preprint arXiv:2412.15287 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-20T15:44:54.240920Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:29.512978Z"},"links":{"citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:bf97ab1ebbd4df4e298c0cd1c836f55f319e650da1c1b9c4d57060123df1575c","observation_id":"67b22cb6-de3c-4a24-b323-b1a84269d16e","resolution":{"observed_at":"2026-08-07T04:37:29.512978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03683","last_updated":"2024-04-01T06:50:52Z","snapshot_observed_at":"2026-08-20T17:23:52.939962Z","submitted_at":"2024-04-01T06:50:52Z","title":"Stream of Search (SoS): Learning to Search in Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03683","snapshot_observed_at":"2026-08-07T04:37:29.746418Z","title":"arXiv preprint arXiv:2404.03683 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-20T15:44:54.240920Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:29.746418Z"},"links":{"cited_paper":"/paper/2404.03683","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:a159428955f5b15d95e54279c79963d7fdf54778861a929e31df5c933a64b3bc","observation_id":"b4301b55-41a7-4964-a3b9-40574ff41443","resolution":{"observed_at":"2026-08-07T04:37:29.746418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02089","last_updated":"2025-02-18T11:39:46Z","snapshot_observed_at":"2026-08-16T13:13:08.983898Z","submitted_at":"2024-10-02T23:25:17Z","title":"RLEF: Grounding Code LLMs in Execution Feedback with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02089","snapshot_observed_at":"2026-08-07T04:37:29.805270Z","title":"arXiv preprint arXiv:2410.02089 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-20T15:44:54.240920Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:29.805270Z"},"links":{"cited_paper":"/paper/2410.02089","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:3841999759e0e327184562ddccb8c72b02eeac3a545a792a961bfe33ca7dc1c9","observation_id":"3b9a162a-60ac-446a-8ddc-30c8f0d508da","resolution":{"observed_at":"2026-08-07T04:37:29.805270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-07T04:37:29.960575Z","title":"5-coder technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-20T15:44:54.240920Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:29.960575Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:f56c1af4fb808b5e31073f75679b3f402e32eca0b444aab967703d0430bdc143","observation_id":"46b454a4-95ff-474f-bee4-d78c48d97283","resolution":{"observed_at":"2026-08-07T04:37:29.960575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T04:37:30.042682Z","title":"arXiv preprint arXiv:2410.21276 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-20T15:44:54.240920Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:30.042682Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:664c5d7b0b71add5f181e56037b81f0c84167602aa0a7ced4150e21c2e212706","observation_id":"59233e2a-8955-4a6b-a21e-f05e28ca516c","resolution":{"observed_at":"2026-08-07T04:37:30.042682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17651","last_updated":"2023-05-25T19:13:47Z","snapshot_observed_at":"2026-08-21T18:20:05.692256Z","submitted_at":"2023-03-30T18:30:01Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17651","snapshot_observed_at":"2026-08-07T04:37:30.178554Z","title":"arXiv preprint arXiv:2303.17651 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-20T15:44:54.240920Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:30.178554Z"},"links":{"cited_paper":"/paper/2303.17651","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:adca8a8b04536819b186bea78e3090451a309c1327a6335344a955089268f5be","observation_id":"9e941f99-4fb5-4202-af35-0900f6a5caa0","resolution":{"observed_at":"2026-08-07T04:37:30.178554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-08-14T05:02:11.716316Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T04:37:30.234365Z","title":"arXiv preprint arXiv:1908.10084 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-20T15:44:54.240920Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:30.234365Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:0fdfad23907bdfa0573ff02bb4992a983bd5f0f541622da94b1ecfcee7a18e91","observation_id":"259ad9ec-5d56-40a1-b865-db09449d6c89","resolution":{"observed_at":"2026-08-07T04:37:30.234365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-07T04:37:30.328965Z","title":"Timo Schick, Jane Dwivedi-Yu, Roberto Dessì, Roberta Raileanu, Maria Lomeli, Eric Hambro, Luke Zettlemoyer, Nicola Cancedda, and Thomas Scialom","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-20T15:44:54.240920Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:30.328965Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:10edd39dc846e1608dcec8c8fdc8e1a3fcb643e0a6e5bb047f182b1aef7b22d2","observation_id":"1ac134b5-0f06-4d92-bcf6-248a6fe79e99","resolution":{"observed_at":"2026-08-07T04:37:30.328965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:37:30.928944Z","title":"Advances in Neural Information Processing Systems 36 (2023), 68539–68551","venue":null,"work_id":"ff00a0f8-0fdc-4f3b-aee1-40a8cbb6205c","year":2023},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-20T15:44:54.240920Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:30.416102Z"},"links":{"citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:0c603253c1e23cc10b2b608797062f7ca4175836640fc8d43f736d1ae70135c0","observation_id":"a2596d1b-9eaa-4455-a10c-3bd2053ee55f","resolution":{"observed_at":"2026-08-07T04:37:30.992778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00238","last_updated":"2023-09-01T04:08:45Z","snapshot_observed_at":"2026-08-19T22:19:08.818590Z","submitted_at":"2023-09-01T04:08:45Z","title":"ALJP: An Arabic Legal Judgment Prediction in Personal Status Cases Using Machine Learning Models","version":1},"cited_work":{"arxiv_id":"2309.00238","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.00238","snapshot_observed_at":"2026-08-07T04:37:30.611863Z","title":"ALJP: An Arabic Legal Judgment Prediction in Personal Status Cases Using Machine Learning Models","venue":"cs.AI","work_id":"f81ebd5f-21db-4762-86bb-d1a785df58e7","year":2023},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-20T15:44:54.240920Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:30.462054Z"},"links":{"cited_paper":"/paper/2309.00238","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:ef6d2c6ba5b006f6f4d3637ff820fc50163eb8a0e1959ce1d03c484301da5537","observation_id":"640b320e-fa86-4451-90c8-29f6488264bd","resolution":{"observed_at":"2026-08-07T04:37:30.687681Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-16T05:27:41.446467Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-07T04:37:30.520795Z","title":"arXiv preprint arXiv:2205.10625 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-20T15:44:54.240920Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:30.520795Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:b2dd2e2bef252c6a1d1298cc089fb0cf7d586f45471b792dad1c12dd4883cb68","observation_id":"366625d7-fecf-4096-be1e-d31814a019e7","resolution":{"observed_at":"2026-08-07T04:37:30.520795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:37:31.034189Z","title":"In Proceedings of the 2019 conference of the North American chapter of the association for computational linguistics: human language technologies, volume 1 (long and short papers)","venue":null,"work_id":"5f50e50d-1388-45b0-b17e-0a79590c539d","year":2019},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-20T15:44:54.240920Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:29.669550Z"},"links":{"citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:07be1dfe6af7de0dbcdea01e628ad8b2d513c5621a58f751e142a593b26596d7","observation_id":"02b4070b-e6d0-4dc9-9a42-fcc2995941ff","resolution":{"observed_at":"2026-08-07T04:37:31.172059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-08-16T13:36:21.119762Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T04:37:29.907111Z","title":"arXiv preprint arXiv:2006.03654 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-20T15:44:54.240920Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:29.907111Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:9ba9394587c0453d7b9367860707782cb43bbd609d39772a882048bc089af748","observation_id":"5a2ca701-2b9b-4b81-b3e4-abec734aa4bc","resolution":{"observed_at":"2026-08-07T04:37:29.907111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-14T00:28:11.851309Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-07T04:37:29.608840Z","title":"arXiv preprint arXiv:2310.01377 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-20T15:44:54.240920Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:29.608840Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:21ece01b4f29ac079a7c247c10b66279ad2f7f504ed45a77cbec8d02a33e2008","observation_id":"787ecde3-dc8e-4df0-b6c3-4c3626bb138b","resolution":{"observed_at":"2026-08-07T04:37:29.608840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-08-09T14:30:33.899591Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T04:37:29.438985Z","title":"arXiv preprint arXiv:2402.14740 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-20T15:44:54.240920Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:29.438985Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:0cb6b59c1f54f39c750435ad64e0ea9bdd86e003d58a6b756b3fe5270b9b10b1","observation_id":"5a339a03-76b0-496e-9880-10cae60cd3d1","resolution":{"observed_at":"2026-08-07T04:37:29.438985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-08-15T13:17:00.526689Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-08-07T04:37:30.121543Z","title":"arXiv preprint arXiv:2503.09516 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-20T15:44:54.240920Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:30.121543Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:e3046f4037fc53d8ae9e954b47c5584b0a7046c4a562e1fdc32e46b715453430","observation_id":"072ae991-3bc8-4471-9ed3-6a86b39a3cf6","resolution":{"observed_at":"2026-08-07T04:37:30.121543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-20T15:44:54.240920Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":2},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 1 inbound Pith citation observation for arXiv:2506.21560."}