{"as_of":"2026-08-14T11:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4ab386b4bd8915d632f1146b0c29a31d962e37b1fe54b1b65f79d5ddec2575b1","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T23:49:05.708180Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:23:52.536677Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T16:01:22.618150Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.04848","snapshot_observed_at":"2026-08-09T18:23:52.536677Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.00612","last_updated":"2025-09-05T16:00:06Z","snapshot_observed_at":"2026-08-09T18:17:31.408381Z","submitted_at":"2025-02-02T00:36:40Z","title":"Using Causality for Enhanced Prediction of Web Traffic Time Series","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T18:23:52.536677Z"},"links":{"cited_paper":"/paper/2508.04848","citing_paper":"/paper/2502.00612"},"observation_digest":"sha256:9d38f465a0ce06ad15e0fcef039bf4326787916588946e41d78cdbcbf9b1e134","observation_id":"f869d388-280c-4d69-8949-c4af9c297b9e","resolution":{"observed_at":"2026-08-09T18:23:52.536677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2508.04848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04848","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4afc3aec-f8e3-4de7-b3bf-6a59cd510832","year":2025},"citing_paper":{"arxiv_id":"2605.00814","last_updated":"2026-05-08T16:52:48Z","snapshot_observed_at":"2026-08-13T11:26:37.424755Z","submitted_at":"2026-05-01T17:54:37Z","title":"Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-09T18:53:06.494640Z"},"links":{"cited_paper":"/paper/2508.04848","citing_paper":"/paper/2605.00814"},"observation_digest":"sha256:edf4e0da2d7960a23ae9ff8b338cc6aae28140a8a1472be75a5a8db4586ef62b","observation_id":"b426df3d-129f-4e23-a706-9cb26d330ce0","resolution":{"observed_at":"2026-05-11T16:01:22.621931Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2508.04848","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.04848","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4afc3aec-f8e3-4de7-b3bf-6a59cd510832","year":2025},"citing_paper":{"arxiv_id":"2605.00814","last_updated":"2026-05-08T16:52:48Z","snapshot_observed_at":"2026-08-13T11:26:37.424755Z","submitted_at":"2026-05-01T17:54:37Z","title":"Persistent Visual Memory: Sustaining Perception for Deep Generation in LVLMs","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-11T01:49:15.136031Z"},"links":{"cited_paper":"/paper/2508.04848","citing_paper":"/paper/2605.00814"},"observation_digest":"sha256:8e75adf15c256d7b13be198d871eca15ac00d8ee3557541a5b5d203568b13e9e","observation_id":"b60805a6-808a-4981-b738-8bea31069308","resolution":{"observed_at":"2026-05-11T01:50:51.662264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.04848/citation-record","integrity":"/paper/2508.04848/integrity","json":"/paper/2508.04848/citation-record.json","paper":"/paper/2508.04848"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.00742","last_updated":"2025-07-01T13:46:00Z","snapshot_observed_at":"2026-08-14T08:12:10.490010Z","submitted_at":"2025-07-01T13:46:00Z","title":"Evaluating LLMs and Prompting Strategies for Automated Hardware Diagnosis from Textual User-Reports","version":1},"cited_work":{"arxiv_id":"2507.00742","doi":null,"metadata_source":"pith","pith_arxiv_id":"2507.00742","snapshot_observed_at":"2026-08-05T23:49:07.405031Z","title":"Evaluating LLMs and Prompting Strategies for Automated Hardware Diagnosis from Textual User-Reports","venue":"cs.LG","work_id":"4fdbfc06-a91d-4b02-8b8b-ed8c4590b0dd","year":2025},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:02.285130Z"},"links":{"cited_paper":"/paper/2507.00742","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:407c727f16ebfbf4697ab75252cdbbfdd9c58ec4bcbdb64addab9684238b69bd","observation_id":"4cd5b0c6-2b61-4a8b-802e-9cd4f7868183","resolution":{"observed_at":"2026-08-05T23:49:07.511703Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:49:07.674149Z","title":null,"venue":null,"work_id":"07400121-d4d0-4c80-bbc6-ec6871d0bac1","year":2024},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:02.550966Z"},"links":{"citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:e1807b67eec1681c0aa055aac60ba27f1a7cd6b394adaff980ab6747b0d9cebc","observation_id":"26e2ce09-01a4-4690-ac40-280bd2d77a25","resolution":{"observed_at":"2026-08-05T23:49:07.820130Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:49:02.715209Z","title":"arXiv preprint arXiv:2503.12434","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:02.715209Z"},"links":{"citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:24c73d318f30c85024558a0fdba8799617e28688aea4e718000e1147cdbb360a","observation_id":"3a6443b6-1c35-4fb7-a39b-93fcaba8ab0b","resolution":{"observed_at":"2026-08-05T23:49:02.715209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T23:49:02.929694Z","title":"arXiv preprint arXiv:2501.12948","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:02.929694Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:6f38c778a820309cf83ac19c4c452076ec7fef05949ff77cd9b136cd62c188fb","observation_id":"cc53431a-943a-4af7-afb6-ffb268577a7a","resolution":{"observed_at":"2026-08-05T23:49:02.929694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01679","last_updated":"2025-06-03T20:51:06Z","snapshot_observed_at":"2026-08-12T22:32:25.074756Z","submitted_at":"2024-10-02T15:49:30Z","title":"VinePPO: Refining Credit Assignment in RL Training of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01679","snapshot_observed_at":"2026-08-05T23:49:03.216906Z","title":"arXiv preprint arXiv:2410.01679","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:03.216906Z"},"links":{"cited_paper":"/paper/2410.01679","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:2404476c98fd5a548e3e51b11349230f3d2fdd392793a76093d69fbc91e9c86b","observation_id":"eed7fb36-b81f-4e42-afde-45576bac2ccc","resolution":{"observed_at":"2026-08-05T23:49:03.216906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21321","last_updated":"2025-03-24T09:34:38Z","snapshot_observed_at":"2026-08-09T09:18:08.427943Z","submitted_at":"2025-02-28T18:59:54Z","title":"LLM Post-Training: A Deep Dive into Reasoning Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21321","snapshot_observed_at":"2026-08-05T23:49:03.474747Z","title":"arXiv preprint arXiv:2502.21321","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:03.474747Z"},"links":{"cited_paper":"/paper/2502.21321","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:ac3b2b372764ab52254385f331349d9e9a777655fdc0d8c2e7451e2adea9e38c","observation_id":"c089ee1b-f9ea-4421-8d1d-ce90170f4779","resolution":{"observed_at":"2026-08-05T23:49:03.474747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T23:49:04.041085Z","title":"arXiv preprint arXiv:2402.03300","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:04.041085Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:a4c6defdc470fcecd63ee55c2fd363f27263b5d576a8cb3cc1510d1cb49b100b","observation_id":"5069f2cf-b853-4e39-a927-395baf2b1c31","resolution":{"observed_at":"2026-08-05T23:49:04.041085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00612","last_updated":"2025-09-05T16:00:06Z","snapshot_observed_at":"2026-08-09T18:17:31.408381Z","submitted_at":"2025-02-02T00:36:40Z","title":"Using Causality for Enhanced Prediction of Web Traffic Time Series","version":2},"cited_work":{"arxiv_id":"2502.00612","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.00612","snapshot_observed_at":"2026-08-05T23:49:06.581628Z","title":"Using Causality for Enhanced Prediction of Web Traffic Time Series","venue":"cs.LG","work_id":"0cb640b2-c13a-4d36-b517-d747c0b20cd8","year":2025},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:04.374494Z"},"links":{"cited_paper":"/paper/2502.00612","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:d3024909f2e29bf6b61c9507c221dd3ff986e9e7ae72f1f6e3388526c861d2c4","observation_id":"2a099c1a-ee77-4545-bebb-118df17d7438","resolution":{"observed_at":"2026-08-05T23:49:06.723730Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18548","last_updated":"2025-03-13T16:48:34Z","snapshot_observed_at":"2026-08-07T17:49:46.596474Z","submitted_at":"2025-02-25T15:56:56Z","title":"What is the Alignment Objective of GRPO?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18548","snapshot_observed_at":"2026-08-05T23:49:04.813342Z","title":"Wang, K.; Pan, J.; Shi, W.; Lu, Z.; Ren, H.; Zhou, A.; Zhan, M.; and Li, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:04.813342Z"},"links":{"cited_paper":"/paper/2502.18548","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:ea86ef4d9e55623e6fe96ced250473b8f2c3c00faee35f67452c384c7be3f506","observation_id":"9453a80a-4f89-45ac-adb3-85b33cfdf8d6","resolution":{"observed_at":"2026-08-05T23:49:04.813342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-08-13T00:17:43.021579Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-08-05T23:49:05.025670Z","title":"arXiv preprint arXiv:2405.00451","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:05.025670Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:d79f792733a3c9626f466ae152ad8e557101f2115d28d7e4a7e5d25ed241b1df","observation_id":"da8eb2be-757c-408d-9572-55982b3900b1","resolution":{"observed_at":"2026-08-05T23:49:05.025670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18587","last_updated":"2026-08-09T21:49:10Z","snapshot_observed_at":"2026-08-13T23:25:50.026392Z","submitted_at":"2025-04-24T01:31:05Z","title":"An Expectation-Maximization Perspective on Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18587","snapshot_observed_at":"2026-08-05T23:49:05.199743Z","title":"arXiv preprint arXiv:2504.18587","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:05.199743Z"},"links":{"cited_paper":"/paper/2504.18587","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:74b04947b77585b46099a5ce206d69a3ea6d5618a6578c7a3c9ed5a5436276c2","observation_id":"4dd15b6d-ed00-430b-b9bf-739dc07bb09e","resolution":{"observed_at":"2026-08-05T23:49:05.199743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-05T23:49:05.395955Z","title":"arXiv preprint arXiv:2503.14476","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:05.395955Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:6f032691047b50af630ca5595ca09be01499533a9b50b4f7a1484ed0cac75c40","observation_id":"b51dbaea-cabf-458e-bd33-21a885642e6d","resolution":{"observed_at":"2026-08-05T23:49:05.395955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T23:49:05.541952Z","title":"arXiv preprint arXiv:2505.17508","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:05.541952Z"},"links":{"citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:35d57618861171ce3a11a078de81d7972181a9750ff2d37bcd8cf091b29aa29c","observation_id":"8197227e-d83e-46e8-b5bb-5485649366a8","resolution":{"observed_at":"2026-08-05T23:49:05.541952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08603","last_updated":"2025-01-31T05:28:15Z","snapshot_observed_at":"2026-08-12T11:01:57.685539Z","submitted_at":"2025-01-15T06:00:50Z","title":"Monte Carlo Tree Search for Comprehensive Exploration in LLM-Based Automatic Heuristic Design","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08603","snapshot_observed_at":"2026-08-05T23:49:05.708180Z","title":"arXiv preprint arXiv:2501.08603","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:05.708180Z"},"links":{"cited_paper":"/paper/2501.08603","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:3e0722b21e61a8d2140589ef298e9aee14b694b6553ba6f48fc011119b7f7b4c","observation_id":"8a413b4d-c7e9-4a91-b607-8b6cf0a66171","resolution":{"observed_at":"2026-08-05T23:49:05.708180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T23:49:03.820612Z","title":"arXiv preprint arXiv:1707.06347","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:03.820612Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:638aaf558e1ec753686fdb3cc4e6a555bad5e4b84667532234577f3a71538f74","observation_id":"c5a07c9f-a069-4938-9dbe-c3d61df449e2","resolution":{"observed_at":"2026-08-05T23:49:03.820612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13103","last_updated":"2025-02-06T15:57:23Z","snapshot_observed_at":"2026-08-12T23:39:40.740248Z","submitted_at":"2024-06-18T23:27:46Z","title":"A Generic Method for Fine-grained Category Discovery in Natural Language Texts","version":2},"cited_work":{"arxiv_id":"2406.13103","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.13103","snapshot_observed_at":"2026-08-05T23:49:06.877878Z","title":"A Generic Method for Fine-grained Category Discovery in Natural Language Texts","venue":"cs.AI","work_id":"e68a0da3-a15f-42d0-bb4e-fa590d97df1c","year":2024},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:04.213823Z"},"links":{"cited_paper":"/paper/2406.13103","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:bae3d6982d51ce543d81c44710ec337b9d7479f533fcda368174f198f2524def","observation_id":"e9fbee50-7381-4d9e-9880-7e86a8620486","resolution":{"observed_at":"2026-08-05T23:49:07.013350Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T23:49:03.062950Z","title":"arXiv preprint arXiv:2009.03300","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:03.062950Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:0bff75231e339498b0b83289956573f4aea8acc45460d6c2981bab51a9da37f0","observation_id":"10b799cd-fa19-409b-8e5e-13ff2688b4a9","resolution":{"observed_at":"2026-08-05T23:49:03.062950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.11682","last_updated":"2021-09-27T21:14:10Z","snapshot_observed_at":"2026-08-13T18:05:41.529667Z","submitted_at":"2021-09-23T22:57:16Z","title":"Paint4Poem: A Dataset for Artistic Visualization of Classical Chinese Poems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.11682","snapshot_observed_at":"2026-08-05T23:49:03.658162Z","title":"arXiv preprint arXiv:2109.11682","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:03.658162Z"},"links":{"cited_paper":"/paper/2109.11682","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:f57f5d156ef1d7e57aadb2afbeba1139d6cd4a925b19b6ef72bf055d26786b6e","observation_id":"9fdfde4a-26c7-4548-9b83-561e8375ee4e","resolution":{"observed_at":"2026-08-05T23:49:03.658162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.11762","last_updated":"2024-04-13T11:51:55Z","snapshot_observed_at":"2026-08-13T14:58:06.739178Z","submitted_at":"2022-07-24T15:38:08Z","title":"Anti-Overestimation Dialogue Policy Learning for Task-Completion Dialogue System","version":2},"cited_work":{"arxiv_id":"2207.11762","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.11762","snapshot_observed_at":"2026-08-05T23:49:06.144931Z","title":"Anti-Overestimation Dialogue Policy Learning for Task-Completion Dialogue System","venue":"cs.CL","work_id":"92309fd6-ef02-462e-8b7b-8f444e12759f","year":2022},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:04.536418Z"},"links":{"cited_paper":"/paper/2207.11762","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:44ebc85cf556ab1f0cab2c0559bf9a92b5a6863a8da1527f0505a32edb001bd2","observation_id":"f8585f12-a48c-4d6d-b420-834437982951","resolution":{"observed_at":"2026-08-05T23:49:06.307243Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02472","last_updated":"2024-11-07T18:30:38Z","snapshot_observed_at":"2026-08-12T22:31:40.743825Z","submitted_at":"2024-10-03T13:25:15Z","title":"Meta-Models: An Architecture for Decoding LLM Behaviors Through Interpreted Embeddings and Natural Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02472","snapshot_observed_at":"2026-08-05T23:49:02.409134Z","title":"arXiv preprint arXiv:2410.02472","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:02.409134Z"},"links":{"cited_paper":"/paper/2410.02472","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:231c0a8e18f86b42d8ac6c86f5962ad20e92a1499f839f5bc0efff6ba3ea02ca","observation_id":"22c06452-16ca-4c32-b0ab-d55ec42d5471","resolution":{"observed_at":"2026-08-05T23:49:02.409134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T23:49:02.173108Z","title":"5-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T23:49:02.173108Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.04848"},"observation_digest":"sha256:96e4aff59c0d3118e41cfb5b35494581f9cff04f2d3e5d953ca319e71d0b0cf0","observation_id":"6c9329a9-57f5-468f-aeec-0c66a4b91d01","resolution":{"observed_at":"2026-08-05T23:49:02.173108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.04848","last_updated":"2025-08-06T19:51:29Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T23:52:59.955522Z","submitted_at":"2025-08-06T19:51:29Z","title":"Large Language Models Reasoning Abilities Under Non-Ideal Conditions After RL-Fine-Tuning"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 3 inbound Pith citation observations for arXiv:2508.04848."}