{"as_of":"2026-08-10T16:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:92a34ebb61744f590862825cbe3eb598bc06712e925876a23283dce4f6c6eb8d","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:33:14.622826Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:46:47.158980Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:27:30.780707Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.14810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-07-03T01:27:30.780707Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models.arXiv preprint arXiv:2505.14810","venue":null,"work_id":"cb0dafd7-6f89-465f-900b-91eba0d0c0fb","year":2025},"citing_paper":{"arxiv_id":"2504.14945","last_updated":"2025-06-22T00:18:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-21T08:09:13Z","title":"Learning to Reason under Off-Policy Guidance","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-15T23:17:02.701393Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2504.14945"},"observation_digest":"sha256:8cd3d10c4fb39ea95325367ddf30b0338a3edb15617abf8927530e47aeb2704d","observation_id":"1e8854ce-8f38-4ae7-9e39-60f8befb076a","resolution":{"observed_at":"2026-05-15T23:17:02.898250Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-08-06T19:46:47.158980Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.04742","last_updated":"2025-07-08T02:54:20Z","snapshot_observed_at":"2026-08-09T09:46:44.281345Z","submitted_at":"2025-07-07T08:16:54Z","title":"Activation Steering for Chain-of-Thought Compression","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:46:47.158980Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2507.04742"},"observation_digest":"sha256:fef5e59c8d070718f194654d05195995cca37926ce935457e2d99d949793f4d3","observation_id":"cd451d3a-100f-4632-acb7-9f442874c142","resolution":{"observed_at":"2026-08-06T19:46:47.158980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-08-06T17:53:47.566505Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09662","last_updated":"2025-07-13T14:51:59Z","snapshot_observed_at":"2026-08-07T01:15:50.475193Z","submitted_at":"2025-07-13T14:51:59Z","title":"Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T17:53:47.566505Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2507.09662"},"observation_digest":"sha256:d894dbe7ce2ddb26b84545c11b66c7760535b1167569856a189574b06d2f3392","observation_id":"87a3f983-2e7c-44fb-b190-219dd66e7440","resolution":{"observed_at":"2026-08-06T17:53:47.566505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-08-06T12:23:55.086609Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.21836","last_updated":"2025-07-29T14:12:28Z","snapshot_observed_at":"2026-08-07T20:39:44.012130Z","submitted_at":"2025-07-29T14:12:28Z","title":"AutoTIR: Autonomous Tools Integrated Reasoning via Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T12:23:55.086609Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2507.21836"},"observation_digest":"sha256:1fc39c4f5e5999cb59a7df426e66e6ad17da9853a9b4931b20fb918ea09db9a4","observation_id":"f4143950-2e76-456e-a840-66278d750e9e","resolution":{"observed_at":"2026-08-06T12:23:55.086609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.14810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-07-03T01:27:30.780707Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models.arXiv preprint arXiv:2505.14810","venue":null,"work_id":"cb0dafd7-6f89-465f-900b-91eba0d0c0fb","year":2025},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":146,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:113b868ca45466bc4dedb3f9cb1fc05dc79015e5b4f7b8c4807423d8d2c280a2","observation_id":"df7b24f1-6691-41a3-8471-0b59b258279a","resolution":{"observed_at":"2026-05-18T00:02:25.397403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.14810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-07-03T01:27:30.780707Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models.arXiv preprint arXiv:2505.14810","venue":null,"work_id":"cb0dafd7-6f89-465f-900b-91eba0d0c0fb","year":2025},"citing_paper":{"arxiv_id":"2509.21743","last_updated":"2026-03-31T22:32:08Z","snapshot_observed_at":"2026-08-10T01:07:51.498001Z","submitted_at":"2025-09-26T01:17:35Z","title":"Retrieval-of-Thought: Efficient Reasoning via Reusing Thoughts","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T13:42:07.883909Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2509.21743"},"observation_digest":"sha256:bb138d7a216dda9933a48067b193ab18d449da5d8f1764d8f35637cac0cbe4fb","observation_id":"1244e1a4-09af-45f5-bc65-927153f45db9","resolution":{"observed_at":"2026-05-18T13:42:38.628885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.14810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-07-03T01:27:30.780707Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models.arXiv preprint arXiv:2505.14810","venue":null,"work_id":"cb0dafd7-6f89-465f-900b-91eba0d0c0fb","year":2025},"citing_paper":{"arxiv_id":"2509.21882","last_updated":"2026-05-25T20:11:55Z","snapshot_observed_at":"2026-08-04T14:57:15.491600Z","submitted_at":"2025-09-26T05:06:25Z","title":"Position: The Hidden Costs and Measurement Gaps of Reinforcement Learning with Verifiable Rewards","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T14:24:48.666197Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2509.21882"},"observation_digest":"sha256:fc71094f178b7168941032bb2b66af0e2ca1bfe15311c87c6e543bb0e739fa72","observation_id":"cd80a8e1-9df3-4476-a93e-309dba05edbc","resolution":{"observed_at":"2026-05-18T14:26:28.356258Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-08-04T07:07:52.626304Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.04694","last_updated":"2026-07-01T16:09:28Z","snapshot_observed_at":"2026-08-04T07:07:51.334462Z","submitted_at":"2025-10-30T22:13:31Z","title":"Reasoning Up the Instruction Ladder for Controllable Language Models","version":5},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T07:07:52.626304Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2511.04694"},"observation_digest":"sha256:2b032d1cc791cb972c061a30f81fc90a7576fca046cd591e397cfee53b709cef","observation_id":"5b236504-6262-4cd1-b48f-05ee07634c87","resolution":{"observed_at":"2026-08-04T07:07:52.626304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.14810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-07-03T01:27:30.780707Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models.arXiv preprint arXiv:2505.14810","venue":null,"work_id":"cb0dafd7-6f89-465f-900b-91eba0d0c0fb","year":2025},"citing_paper":{"arxiv_id":"2602.21228","last_updated":"2026-04-20T12:48:23Z","snapshot_observed_at":"2026-08-02T12:14:20.654135Z","submitted_at":"2026-02-04T07:50:11Z","title":"ImpRIF: Stronger Implicit Reasoning Leads to Better Complex Instruction Following","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T07:59:35.303413Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2602.21228"},"observation_digest":"sha256:d2ee92d00d54f6fe1304d0f1194a875f63ff42ca4259df9920a92f6b8021d2d1","observation_id":"035981a2-0272-45d4-abc0-f931a2a19ce8","resolution":{"observed_at":"2026-05-16T08:00:44.619454Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.14810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-07-03T01:27:30.780707Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models.arXiv preprint arXiv:2505.14810","venue":null,"work_id":"cb0dafd7-6f89-465f-900b-91eba0d0c0fb","year":2025},"citing_paper":{"arxiv_id":"2606.04160","last_updated":"2026-06-02T19:23:46Z","snapshot_observed_at":"2026-08-07T08:17:37.830144Z","submitted_at":"2026-06-02T19:23:46Z","title":"Expert-Aware Refusal Steering","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-28T10:04:13.562338Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2606.04160"},"observation_digest":"sha256:c6a465529bd53a270d3d182779b4c74afb7363d1a4d848418a517cc0619a5630","observation_id":"5d43761b-0d0d-4906-a652-117b55d16885","resolution":{"observed_at":"2026-07-02T03:26:29.106120Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":"2505.14810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-07-03T01:27:30.780707Z","title":"Scaling reasoning, losing control: Evaluating instruction following in large reasoning models.arXiv preprint arXiv:2505.14810","venue":null,"work_id":"cb0dafd7-6f89-465f-900b-91eba0d0c0fb","year":2025},"citing_paper":{"arxiv_id":"2606.09662","last_updated":"2026-06-08T15:45:04Z","snapshot_observed_at":"2026-08-06T09:33:48.753803Z","submitted_at":"2026-06-08T15:45:04Z","title":"When Built-in Thinking Helps and Hurts: Constraint-Level Error Shifts in Instruction Following","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-27T16:33:59.661761Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2606.09662"},"observation_digest":"sha256:f0c65d90e88a66954401eaf0c1378e34cb8490eca70e132f562ebb9c2e3d1e99","observation_id":"a5be2a59-61f1-4517-b01d-8da2e092dabe","resolution":{"observed_at":"2026-07-03T01:27:30.782222Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14810","snapshot_observed_at":"2026-07-14T12:08:05.502310Z","title":"arXiv preprint arXiv:2505.14810 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10386","last_updated":"2026-07-11T16:29:51Z","snapshot_observed_at":"2026-08-09T21:55:27.858700Z","submitted_at":"2026-07-11T16:29:51Z","title":"Structured Thoughts For Improved Reasoning And Context Pruning","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-14T12:08:05.502310Z"},"links":{"cited_paper":"/paper/2505.14810","citing_paper":"/paper/2607.10386"},"observation_digest":"sha256:d66da72a3bb6ad1375d58a4bce395020c120d99b653bbaf4422846e7651628b0","observation_id":"f2244e3d-ae28-4746-96ff-a48ba458ff32","resolution":{"observed_at":"2026-07-14T12:08:05.502310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14810/citation-record","integrity":"/paper/2505.14810/integrity","json":"/paper/2505.14810/citation-record.json","paper":"/paper/2505.14810"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:10.157381Z","title":"A survey of efficient reasoning for large reasoning models: Language, multimodality, and beyond.arXiv preprint arXiv:2503.21614, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.157381Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:0dd63a064ea75bbea5ee5c0244ad8098609a776997ae1715e8867683d83b80db","observation_id":"44568d9e-23c9-485f-8e98-0824b2d06ecf","resolution":{"observed_at":"2026-08-07T15:33:10.157381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:17.264477Z","title":"Introducing openai o3 and o4-mini","venue":null,"work_id":"b70291c9-f54e-48a7-bd23-c76072160918","year":null},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.208482Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:013cb831c4ad5b78274a35a18ff1c934c4cb7c8bac39cba871adc232a57dc1dd","observation_id":"65eaa0d6-7f87-479e-9758-3cc235820994","resolution":{"observed_at":"2026-08-07T15:33:17.316784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:10.246442Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.246442Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:47f5c45a9ff3d966eaadd4dea33027c619564e82bd8fca92e84afddaaea63820","observation_id":"47a35041-50e0-4fdc-8ffb-97c75c48fe23","resolution":{"observed_at":"2026-08-07T15:33:10.246442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:10.307082Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.307082Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:89c0bc3fd7b0580cb49ee45979c54146a399ee6d3d19dc004edb4308eaaa78cc","observation_id":"2c7a2c4f-99c9-4c9a-ae76-32bfbf88e23c","resolution":{"observed_at":"2026-08-07T15:33:10.307082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:10.370272Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.370272Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:0c1235e4ce669460a631432da655895672851912a31db3b939939cd2d1460eff","observation_id":"5b26cc8b-3281-4877-8961-b99584ef6053","resolution":{"observed_at":"2026-08-07T15:33:10.370272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T15:33:10.452157Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.452157Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:c9149b313532ea744541788d19e4ab30f6902fac04f1d7f68efb0e0644fdb9f9","observation_id":"d9b5b964-b0ef-4d25-b0a2-003cf15c219e","resolution":{"observed_at":"2026-08-07T15:33:10.452157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:10.518270Z","title":"Aime problem set 1983-2024, 2023","venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.518270Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:15ab46585447eee9137e16b9ad630e79af10882011a522e14d57a720bdf7ea78","observation_id":"7b153dfa-26f1-4809-be95-e2b9b1e63776","resolution":{"observed_at":"2026-08-07T15:33:10.518270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:10.568995Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.568995Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:fdff19dc078791bdf2d916659a50cc6e7cf3931b51ea056d410d25058e4fb2cf","observation_id":"2dd24725-91cb-47cd-b3a2-efc412a34f00","resolution":{"observed_at":"2026-08-07T15:33:10.568995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:10.639989Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.639989Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:3c15e3067bc32e34af502fdc805e5bb40bb645f8c295a48b150b4a7af7bac577","observation_id":"18bd3729-b3b4-4c53-b40a-9fd402adf3d2","resolution":{"observed_at":"2026-08-07T15:33:10.639989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:17.014841Z","title":"Crossing the reward bridge: Expanding rl with verifiable rewards across diverse domains, 2025","venue":null,"work_id":"837f8f35-7e9c-4687-b171-558c7dc0e345","year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.722778Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:68d1cc7fb8189e29b88ef3180bd2b768102ce49ff2fd68d3691e21133505118a","observation_id":"242ded00-ce83-493d-b0a4-cd4920915107","resolution":{"observed_at":"2026-08-07T15:33:17.080686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:10.783973Z","title":"A survey on llm-as-a-judge, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.783973Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:41e3d1e3a5a5622bca800532745eb8b326360ddc414c2638866e24fb40c2ade9","observation_id":"f6dd2e34-7add-447c-b744-8234be23c9b3","resolution":{"observed_at":"2026-08-07T15:33:10.783973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T15:33:10.861362Z","title":"Instruction-following evaluation for large language models.arXiv preprint arXiv:2311.07911, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.861362Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:42ccb9d3d3445ac2fe30670adf49f9553d5e8c822208c376498b2067a4b30d4a","observation_id":"a33b4e24-dc98-45f0-a3e2-f428740bf069","resolution":{"observed_at":"2026-08-07T15:33:10.861362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20410","last_updated":"2024-06-05T15:39:26Z","snapshot_observed_at":"2026-08-08T02:42:16.160487Z","submitted_at":"2023-10-31T12:32:38Z","title":"FollowBench: A Multi-level Fine-grained Constraints Following Benchmark for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20410","snapshot_observed_at":"2026-08-07T15:33:10.940404Z","title":"Followbench: A multi-level fine-grained constraints following benchmark for large language models.arXiv preprint arXiv:2310.20410, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.940404Z"},"links":{"cited_paper":"/paper/2310.20410","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:c72616e52562152bba7479fa0cd9f5383315af5152a2d00470b1e56764726539","observation_id":"6e794753-fe77-449e-8d01-208d32f78d11","resolution":{"observed_at":"2026-08-07T15:33:10.940404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T15:33:10.981211Z","title":"s1: Simple test-time scaling.arXiv preprint arXiv:2501.19393, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:10.981211Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:1b2f17d3936c8c4e46b93eac13bc36fbc170d33f16eb7398828205e9e94a1812","observation_id":"5964b2cc-872b-4985-9287-f2872170f483","resolution":{"observed_at":"2026-08-07T15:33:10.981211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:11.057906Z","title":"Limo: Less is more for reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.057906Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:df6c6797b3cbc4445a4f44e602c0afbe0aa0272799c416ccff813456145490fe","observation_id":"bb7d4fd3-53a1-4468-a2f1-8d85f9fd58e9","resolution":{"observed_at":"2026-08-07T15:33:11.057906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:11.148146Z","title":"Demystifying long chain-of-thought reasoning in llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.148146Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:e6b3d76def3d9c7da4a686b174ce0095a9cf7b59da5796e28b7e64feb14aa228","observation_id":"d988746a-3274-4130-af2b-b319f12ac6f4","resolution":{"observed_at":"2026-08-07T15:33:11.148146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:11.225305Z","title":"SFT memorizes, RL generalizes: A comparative study of foundation model post-training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.225305Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:01cf14b52e0e3ddb13a7e3be4beebcec45cc4c3444e6a54407998a18b61e5b61","observation_id":"27eceab6-b648-490e-8d28-ce69017e3b3d","resolution":{"observed_at":"2026-08-07T15:33:11.225305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:11.311589Z","title":"There may not be aha moment in r1-zero-like training — a pilot study","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.311589Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:9e3e47de480b91e4d372f43af2291509c0a873ee341ca2e2058cd81aac86d72a","observation_id":"f344a563-8832-4594-b617-c98677f4577a","resolution":{"observed_at":"2026-08-07T15:33:11.311589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T15:33:11.407955Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.407955Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:5ddf949ff677c56f7db883d8f133b056885bea2384583ace50c85323b4a16398","observation_id":"a25740f0-4537-4d6f-8f54-d60862085901","resolution":{"observed_at":"2026-08-07T15:33:11.407955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-07T15:33:11.486382Z","title":"Process reinforcement through implicit rewards.arXiv preprint arXiv:2502.01456, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.486382Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:5fa7489885acd8cf68a64e2412328c5ef363ab348a8f17a78a3e4fdc968b7f2e","observation_id":"4d772c21-66fd-496d-8fcd-fbe6ccde9a3d","resolution":{"observed_at":"2026-08-07T15:33:11.486382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:11.560154Z","title":"Learning to reason under off-policy guidance, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.560154Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:9a273cae7a020946383d67349210b5a3aad76b0f5195e60320967ad02269fc6f","observation_id":"92ce5b9b-bf31-467e-aafe-b599b15e1fdb","resolution":{"observed_at":"2026-08-07T15:33:11.560154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13173","last_updated":"2025-02-17T19:56:21Z","snapshot_observed_at":"2026-08-07T18:11:02.754125Z","submitted_at":"2025-02-17T19:56:21Z","title":"Thinking Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13173","snapshot_observed_at":"2026-08-07T15:33:11.638080Z","title":"Thinking preference optimization.arXiv preprint arXiv:2502.13173, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.638080Z"},"links":{"cited_paper":"/paper/2502.13173","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:92058d02856c52673913da0daca62837227d29943101e8b99f46ba6d76e306cf","observation_id":"de45736f-69f1-464f-8f18-338b7dba298d","resolution":{"observed_at":"2026-08-07T15:33:11.638080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:11.738840Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.738840Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:e3c0d2b1fab4eae44ef5726c66743df7fb225aa2e4ddf4732ee01e951226754d","observation_id":"0162cf0f-ef5e-40e7-bfb3-9c06587da67c","resolution":{"observed_at":"2026-08-07T15:33:11.738840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:11.809584Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.809584Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:3b86f55022b572dca236dd1c0b10427b73773185108f4d186570e57df40652f4","observation_id":"a56b2ab7-afc0-4d9c-8d4e-716add35b17c","resolution":{"observed_at":"2026-08-07T15:33:11.809584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:16.728796Z","title":"FOFO: A benchmark to evaluate LLMs’ format-following capability","venue":null,"work_id":"b098f4d2-5d00-4799-a15f-ab46fc2ba80b","year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:11.922967Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:cec4e88e34c65c770e803c22daf2512f29749556ed9b73a1190d8d9cc502b6bd","observation_id":"dd55063f-3abd-499a-95a8-4b6a268df8c6","resolution":{"observed_at":"2026-08-07T15:33:16.800930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:16.542175Z","title":null,"venue":null,"work_id":"fa49db34-3edb-4e6c-a378-8ca2c42461a9","year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.043697Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:00cf41653b7a427002e6bb86de22f3263766da3f4f07aa6489fe7e412c6ead58","observation_id":"e94cee61-4939-4de0-b284-97e4471d10c5","resolution":{"observed_at":"2026-08-07T15:33:16.608320Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15553","last_updated":"2024-11-13T04:26:13Z","snapshot_observed_at":"2026-07-06T19:36:45.701678Z","submitted_at":"2024-10-21T00:59:47Z","title":"Multi-IF: Benchmarking LLMs on Multi-Turn and Multilingual Instructions Following","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15553","snapshot_observed_at":"2026-08-07T15:33:12.154089Z","title":"Multi-if: Benchmarking llms on multi-turn and multilingual instructions following.arXiv preprint arXiv:2410.15553, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.154089Z"},"links":{"cited_paper":"/paper/2410.15553","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:1d2459fde74653cc6d929e708c401e44a89607826c1c4785a95a559d5b0eb0e5","observation_id":"8bb70e02-d4e0-48a9-bcff-a8cc018a5b53","resolution":{"observed_at":"2026-08-07T15:33:12.154089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14494","last_updated":"2025-05-30T04:20:31Z","snapshot_observed_at":"2026-08-07T18:02:12.486572Z","submitted_at":"2025-02-20T12:22:18Z","title":"StructFlowBench: A Structured Flow Benchmark for Multi-turn Instruction Following","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14494","snapshot_observed_at":"2026-08-07T15:33:12.228882Z","title":"Structflowbench: A structured flow benchmark for multi-turn instruction following.arXiv preprint arXiv:2502.14494, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.228882Z"},"links":{"cited_paper":"/paper/2502.14494","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:b3078eb870afd414102b1d8e810d17674ee796a1cc2b884d7bdd11747e66a7bf","observation_id":"17fbfcef-6d59-4686-aad8-7d66ebad32a5","resolution":{"observed_at":"2026-08-07T15:33:12.228882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:12.305782Z","title":"Can language models follow multiple turns of entangled instructions?arXiv preprint arXiv:2503.13222, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.305782Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:afb022e93ad21d186859a529f1e066f9fa2a478b33b21f2c8d8b2d7b3a11c8db","observation_id":"022c8737-095b-40c0-96c4-b31b2ec9154c","resolution":{"observed_at":"2026-08-07T15:33:12.305782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17399","last_updated":"2025-03-06T04:41:56Z","snapshot_observed_at":"2026-08-10T04:40:42.053539Z","submitted_at":"2025-01-29T03:29:24Z","title":"MultiChallenge: A Realistic Multi-Turn Conversation Evaluation Benchmark Challenging to Frontier LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17399","snapshot_observed_at":"2026-08-07T15:33:12.420401Z","title":"Multichallenge: A realistic multi-turn conversation evaluation benchmark challenging to frontier llms.arXiv preprint arXiv:2501.17399, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.420401Z"},"links":{"cited_paper":"/paper/2501.17399","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:3523defb8f084ed78fb7ea9f9c1a7a5bf7a12ea68ecf4b271f6fe1657b5a2e3a","observation_id":"6e46e7b3-0481-483d-8932-7b2ab6cebf05","resolution":{"observed_at":"2026-08-07T15:33:12.420401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07037","last_updated":"2025-07-23T22:08:05Z","snapshot_observed_at":"2026-08-07T09:03:10.840603Z","submitted_at":"2024-11-11T14:43:51Z","title":"LIFBench: Evaluating the Instruction Following Performance and Stability of Large Language Models in Long-Context Scenarios","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07037","snapshot_observed_at":"2026-08-07T15:33:12.524178Z","title":"Lifbench: Evaluating the instruction following performance and stability of large language models in long-context scenarios.arXiv preprint arXiv:2411.07037, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.524178Z"},"links":{"cited_paper":"/paper/2411.07037","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:d0b08c231c807755fd51c7dccf63ce9c8125f692b29c0bc822e1997dcee980ba","observation_id":"28e29008-b9b2-4a36-879c-89128bc6f3d3","resolution":{"observed_at":"2026-08-07T15:33:12.524178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:12.608031Z","title":"Xifbench: Evaluating large language models on multilingual instruction following","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.608031Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:684c2e8e0f90848b751ad271b7ec5dfa05d38c46aaf0f018b1a7e21a603606eb","observation_id":"41151d93-1676-4dfb-97cf-ecc2cea02dcc","resolution":{"observed_at":"2026-08-07T15:33:12.608031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:16.366994Z","title":"IHEval: Evaluating language models on following the instruction hierarchy","venue":null,"work_id":"a03401fe-1bbc-4c06-93ed-98f6bc29c92e","year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.671400Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:034e9b841893bd682dd7bf601997f61a8c3defd68d6709179aa6a0473e19819a","observation_id":"cbd99d66-e41f-4dc3-ac5d-80aa18f35783","resolution":{"observed_at":"2026-08-07T15:33:16.432287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:16.187155Z","title":"Chain-of-instructions: Compositional instruction tuning on large language models","venue":null,"work_id":"c418f530-fba4-4274-95b9-1b6bb4b123f3","year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.869124Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:b579ee725e207481c43f4f7641981c9ff73ec69a495fbedc562e79ffe379a72f","observation_id":"53abe998-55b1-4760-922b-e120406ac5de","resolution":{"observed_at":"2026-08-07T15:33:16.265814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:16.023175Z","title":"RefuteBench: Evaluating refuting instruction-following for large language models","venue":null,"work_id":"85f57eac-ff8b-4f05-a0b2-0e1bd570e5ba","year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.970356Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:dd8390275a5f6507b98a854f92ceabdfc50ee927a9e4d810a1826e5b5d371883","observation_id":"53656fb6-10c5-43f2-b5c3-cdc3f7ae0f64","resolution":{"observed_at":"2026-08-07T15:33:16.093504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:15.856890Z","title":"Refutebench 2.0 – agentic benchmark for dynamic evaluation of llm responses to refutation instruction, 2025","venue":null,"work_id":"09419323-9fc8-4136-8804-cf85ba9ea34a","year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.063240Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:d725fc30719da39f3eaeb29707d28e0221da97e7b8b8916339299e0d7c9c368b","observation_id":"a81c3877-1496-43b9-8e72-46959fe21fe1","resolution":{"observed_at":"2026-08-07T15:33:15.938425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:13.132176Z","title":"Benchmarking complex instruction-following with multiple constraints composition.Advances in Neural Information Processing Systems, 37:137610– 137645, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.132176Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:d659ab99fa42d2ce55eb2643c4cd71c1f822cb0f5a81f4fbc1d254ae3ce30c44","observation_id":"1dc49d07-536f-49d5-af35-f5ed750fec17","resolution":{"observed_at":"2026-08-07T15:33:13.132176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T15:33:13.201382Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.201382Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:3f6daceeea6ebb2167bbdc2095303e5f7d1536bec724990199d9c5dd9c276e2c","observation_id":"c15a7049-461a-4614-9ebf-2a802448278b","resolution":{"observed_at":"2026-08-07T15:33:13.201382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T15:33:13.276979Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.276979Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:f08abe7b7ab23b1bcba75b20b2320043a1c1ad7c48a5479a61cf4188bd6e9471","observation_id":"10907a57-b443-4eff-8db6-2aa6a0c68a11","resolution":{"observed_at":"2026-08-07T15:33:13.276979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:15.682638Z","title":"Minerva: Accelerating data analysis in next-generation ssds","venue":null,"work_id":"ba1ff5db-45df-47f7-bb01-b577ef159748","year":2013},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.341352Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:bdfa6701a4c9d58b3e5486d19ea61f05d0408bb76315c48b1369eb8d56b69d6b","observation_id":"e3db8243-d059-40b1-8ece-eb9e9b71d518","resolution":{"observed_at":"2026-08-07T15:33:15.745229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:13.429582Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.429582Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:f009dfd2b59c764401f1f18d665c3a8907b5d1371a236b6e2633fd9060bc026a","observation_id":"81bdc687-70e6-4f71-af8d-29c061b47e1a","resolution":{"observed_at":"2026-08-07T15:33:13.429582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:13.532662Z","title":"Qwen3, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.532662Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:5f052c58f6ee4825db4be1cb270337cc0a51e3b99e0973d3669f3f9d15e9c14a","observation_id":"11a41faa-a906-4367-b22e-7db1df5f14e5","resolution":{"observed_at":"2026-08-07T15:33:13.532662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T15:33:13.621188Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild.arXiv preprint arXiv:2503.18892, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.621188Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:d98458326b8a4e97e7748eb3dca2fee05632d2abfc461855eb5882d8bf566fce","observation_id":"55f2cf9e-82ae-4bbc-9a03-aa64511f35d8","resolution":{"observed_at":"2026-08-07T15:33:13.621188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-07T15:33:13.735556Z","title":"Qwen2.5-math technical report: Toward mathematical expert model via self-improvement.arXiv preprint arXiv:2409.12122, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.735556Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:9583cee9c5b671683533ec92cfee2566c456ff1adb39106afd94aa3ed5e5bf7b","observation_id":"79fa9c6b-3bd0-4099-9b08-824846a7d1f1","resolution":{"observed_at":"2026-08-07T15:33:13.735556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:13.835666Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.835666Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:67ed7557d6f5e1410ba4559ba5a5a466a7f864272926a727005b7729631154d7","observation_id":"f49f2bd5-2c6d-4f20-8d8d-a2dddf292488","resolution":{"observed_at":"2026-08-07T15:33:13.835666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-07T15:33:13.910728Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning.arXiv preprint arXiv:2503.04697, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:13.910728Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:2d623571e9228fe9fe1a547a4674f8e321577639e75d11719e06a8ea89aea92f","observation_id":"dcec4b4d-7758-4c3d-9930-0c4c215f67e4","resolution":{"observed_at":"2026-08-07T15:33:13.910728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T15:33:14.005401Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model.arXiv preprint arXiv:2503.24290, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:14.005401Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:f576943736a24120cc90fe6823dcbc6dab7bcf2a016d3e193fe5cac83b651846","observation_id":"0cac9504-c05f-4349-a0ec-c1b24cc81c41","resolution":{"observed_at":"2026-08-07T15:33:14.005401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:14.083554Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:14.083554Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:c31c04e42b47e3daf03b509f608296cfaf036676b9175da8e1623cdb1709f1ce","observation_id":"d6dc24a3-efa5-479b-adbe-fac5ed3701fe","resolution":{"observed_at":"2026-08-07T15:33:14.083554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:14.221930Z","title":"Qwq-32b: Embracing the power of reinforcement learning, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:14.221930Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:2cc3f5d2b776b536d7bec378e236e506c841bfdf97cb34e07809177e05f3d1d8","observation_id":"f43c058a-ad96-4a97-8379-471d5590d1fc","resolution":{"observed_at":"2026-08-07T15:33:14.221930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:14.341149Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:14.341149Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:93c94263e335a4bdb082c56156fe8d981d3bdd4735ff487f388bc9075068eb50","observation_id":"79f0a2f6-98d9-45a0-ac80-fb90fb618d74","resolution":{"observed_at":"2026-08-07T15:33:14.341149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:14.438481Z","title":"Roformer: Enhanced transformer with rotary position embedding.Neurocomputing, 568:127063, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:14.438481Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:87cdd7a47f83fde2f99c3926c946f0cec9ab1361aaa4311b93a35a7c18735fba","observation_id":"c73eeb6f-0dd0-42b2-85bc-58f3076f5df9","resolution":{"observed_at":"2026-08-07T15:33:14.438481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T15:33:14.543415Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:14.543415Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:4179ff8bdfa4c53209d9f3e233ae892d8c2d41dba12e43060f37e5df895fa410","observation_id":"2bd12cc8-133b-4fd6-8560-9ffb777bc94e","resolution":{"observed_at":"2026-08-07T15:33:14.543415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:15.407358Z","title":"The impact of reasoning step length on large language models","venue":null,"work_id":"2c6c2aed-8c29-4a81-aeca-dc8acb194d9e","year":2024},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:14.622826Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:308a6365cc9d979ba5c7d152a294cdea2e574b1d5393892989e443eac090179c","observation_id":"ebf27aa1-fe25-4327-a976-0eac331754cd","resolution":{"observed_at":"2026-08-07T15:33:15.469178Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:33:12.796349Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T15:33:12.796349Z"},"links":{"citing_paper":"/paper/2505.14810"},"observation_digest":"sha256:734e0e58f7d2325f301ff6414534c815609ecfb95d97caa4cca0d917eecfc868","observation_id":"2ff083fc-448b-4229-a8eb-0199ed4cec8c","resolution":{"observed_at":"2026-08-07T15:33:12.796349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14810","last_updated":"2025-05-25T14:52:51Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T05:24:12.504550Z","submitted_at":"2025-05-20T18:18:01Z","title":"Scaling Reasoning, Losing Control: Evaluating Instruction Following in Large Reasoning Models"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 12 inbound Pith citation observations for arXiv:2505.14810."}