{"as_of":"2026-08-15T09:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:76f219b1fa89a58d7f2774f464bae05edb3809edcfba39744665584662179556","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:36:54.555335Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:43:00.923422Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T02:16:26.183764Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2505.14625","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14625","snapshot_observed_at":"2026-07-02T02:16:26.183764Z","title":"Tinyv: Reducing false negatives in verification improves rl for llm reasoning","venue":null,"work_id":"851de516-697c-423c-8c2b-4f5fbdf5ac13","year":2025},"citing_paper":{"arxiv_id":"2510.00915","last_updated":"2026-05-22T12:16:11Z","snapshot_observed_at":"2026-08-15T01:19:02.750743Z","submitted_at":"2025-10-01T13:56:44Z","title":"Reinforcement Learning with Verifiable yet Noisy Rewards under Imperfect Verifiers","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-25T07:39:02.616294Z"},"links":{"cited_paper":"/paper/2505.14625","citing_paper":"/paper/2510.00915"},"observation_digest":"sha256:c55b2b4ef2cc6fabd94cc07a4f39857f94e8e8b749a5169f69d92b5dceede73b","observation_id":"3e48e768-8302-413e-96bd-f89841ee7373","resolution":{"observed_at":"2026-05-25T07:40:28.721581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2505.14625","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14625","snapshot_observed_at":"2026-07-02T02:16:26.183764Z","title":"Tinyv: Reducing false negatives in verification improves rl for llm reasoning","venue":null,"work_id":"851de516-697c-423c-8c2b-4f5fbdf5ac13","year":2025},"citing_paper":{"arxiv_id":"2605.02909","last_updated":"2026-04-06T15:02:52Z","snapshot_observed_at":"2026-08-15T02:26:17.104829Z","submitted_at":"2026-04-06T15:02:52Z","title":"Delay, Plateau, or Collapse: Evaluating the Impact of Systematic Verification Error on RLVR","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-10T18:52:52.969408Z"},"links":{"cited_paper":"/paper/2505.14625","citing_paper":"/paper/2605.02909"},"observation_digest":"sha256:a815b7184a870e3494d1ea028efdbc6e40050b64aec2a99554174fa658abb04c","observation_id":"42f34f68-8adb-4ba9-baf8-69569e51f279","resolution":{"observed_at":"2026-05-10T23:45:53.117674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2505.14625","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14625","snapshot_observed_at":"2026-07-02T02:16:26.183764Z","title":"Tinyv: Reducing false negatives in verification improves rl for llm reasoning","venue":null,"work_id":"851de516-697c-423c-8c2b-4f5fbdf5ac13","year":2025},"citing_paper":{"arxiv_id":"2605.05076","last_updated":"2026-05-24T22:21:17Z","snapshot_observed_at":"2026-08-11T18:23:56.230059Z","submitted_at":"2026-05-06T16:11:09Z","title":"High-Dimensional Statistics: Reflections on Progress and Open Problems","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-08T15:35:08.202464Z"},"links":{"cited_paper":"/paper/2505.14625","citing_paper":"/paper/2605.05076"},"observation_digest":"sha256:92944c2310ce9f09bfee3f807ba524301871b263e7dda161d81d52844be94b58","observation_id":"c04c54cf-8883-403e-b34a-b417301c2bce","resolution":{"observed_at":"2026-05-11T18:36:06.803837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2505.14625","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14625","snapshot_observed_at":"2026-07-02T02:16:26.183764Z","title":"Tinyv: Reducing false negatives in verification improves rl for llm reasoning","venue":null,"work_id":"851de516-697c-423c-8c2b-4f5fbdf5ac13","year":2025},"citing_paper":{"arxiv_id":"2605.05076","last_updated":"2026-05-24T22:21:17Z","snapshot_observed_at":"2026-08-11T18:23:56.230059Z","submitted_at":"2026-05-06T16:11:09Z","title":"High-Dimensional Statistics: Reflections on Progress and Open Problems","version":2},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-06-30T23:25:55.375541Z"},"links":{"cited_paper":"/paper/2505.14625","citing_paper":"/paper/2605.05076"},"observation_digest":"sha256:bd25baf3b7f3ed7de589ed04923bcc39028ca3b75efd0ecd316db694bb5d80e7","observation_id":"84e5ac04-f9fb-47ee-a91c-3ba5aa9b5650","resolution":{"observed_at":"2026-07-01T13:15:46.717605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2505.14625","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14625","snapshot_observed_at":"2026-07-02T02:16:26.183764Z","title":"Tinyv: Reducing false negatives in verification improves rl for llm reasoning","venue":null,"work_id":"851de516-697c-423c-8c2b-4f5fbdf5ac13","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-08-12T03:28:30.781632Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":187,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.14625","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:9d23a60a197cafad73bf8020a5b826941d3db6ab50b20224409ceed42230f085","observation_id":"ae651858-8e70-472e-9370-c824e5cd6fd5","resolution":{"observed_at":"2026-07-01T20:46:14.318017Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"cited_work":{"arxiv_id":"2505.14625","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14625","snapshot_observed_at":"2026-07-02T02:16:26.183764Z","title":"Tinyv: Reducing false negatives in verification improves rl for llm reasoning","venue":null,"work_id":"851de516-697c-423c-8c2b-4f5fbdf5ac13","year":2025},"citing_paper":{"arxiv_id":"2606.03800","last_updated":"2026-07-07T21:08:01Z","snapshot_observed_at":"2026-08-13T02:54:16.566025Z","submitted_at":"2026-06-02T15:48:28Z","title":"Trading Human Curation for Synthetic Augmentation in RLVR","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T11:10:06.685591Z"},"links":{"cited_paper":"/paper/2505.14625","citing_paper":"/paper/2606.03800"},"observation_digest":"sha256:8adf39c17c88bf91b0bcdee6512377070bf7fe16cd1a6e0626004f7c9efd9243","observation_id":"607992f7-4e8e-4307-abe4-9675df8e705b","resolution":{"observed_at":"2026-07-02T02:16:26.185430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14625","snapshot_observed_at":"2026-07-12T15:15:09.675778Z","title":"TinyV: Reducing false negatives in verification improves RL for LLM reasoning.arXiv:2505.14625, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.03800","last_updated":"2026-07-07T21:08:01Z","snapshot_observed_at":"2026-08-13T02:54:16.566025Z","submitted_at":"2026-06-02T15:48:28Z","title":"Trading Human Curation for Synthetic Augmentation in RLVR","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-12T15:15:09.675778Z"},"links":{"cited_paper":"/paper/2505.14625","citing_paper":"/paper/2606.03800"},"observation_digest":"sha256:3e4b3d1a901eff00ddc8e879203c169d2c610c0475f1bae93e45f4d34af611a7","observation_id":"4b0a04ab-7d48-4726-979c-99ad29cd69c5","resolution":{"observed_at":"2026-07-12T15:15:09.675778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14625","snapshot_observed_at":"2026-08-06T00:43:00.923422Z","title":"TinyV: Reducing false negatives in verification improves RL for LLM reasoning.arXiv preprint arXiv:2505.14625, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-15T05:57:28.448446Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T00:43:00.923422Z"},"links":{"cited_paper":"/paper/2505.14625","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:96a7d62fa9c9e4c0e62feda3ee436bb702c5eaafac07447bc35ae03975665445","observation_id":"fcb0a385-ed47-474e-88e8-9680e753f793","resolution":{"observed_at":"2026-08-06T00:43:00.923422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14625/citation-record","integrity":"/paper/2505.14625/integrity","json":"/paper/2505.14625/citation-record.json","paper":"/paper/2505.14625"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:49.050333Z","title":"Big-math: A large-scale, high-quality math dataset for reinforcement learning in language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:49.050333Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:b803df37efafcea6ce2560b960647e0e371fec3eb075239828793cb4160b788f","observation_id":"56aaa975-7b28-424b-8d22-68df808f6885","resolution":{"observed_at":"2026-08-07T15:36:49.050333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:49.101516Z","title":"Online difficulty filtering for reasoning oriented reinforcement learning.arXiv preprint arXiv:2504.03380, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:49.101516Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:383a42dafc2a093becf156578791a0354f20b0767182002edc658f7261c3736f","observation_id":"aa829132-5b02-4f00-813a-89c78d605902","resolution":{"observed_at":"2026-08-07T15:36:49.101516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:59.557845Z","title":"Robotxr1: Enabling embodied robotic intelligence on large language models through closed-loop reinforcement learning, 2025","venue":null,"work_id":"ee900e6a-e942-4ec3-a7e0-b8bad82e3b17","year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:49.161442Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:8c060f373abb1d553a91bb80078ae11ab56daaeedafbc604f1670a74ed4924fc","observation_id":"7eb3a90b-efdb-4823-a7f5-f85a8f59ef02","resolution":{"observed_at":"2026-08-07T15:36:59.677826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:59.272421Z","title":"xverify: Efficient answer verifier for reasoning model evaluations, 2025","venue":null,"work_id":"bdf559ef-6b2a-4798-852a-01b09ea20655","year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:49.231062Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:3b7d3a3d528f9811c4207d3ca96ecce71d5553f97e0f33e088b55d0de6821ccf","observation_id":"93031f66-d74d-4699-b9ff-c2290a75f510","resolution":{"observed_at":"2026-08-07T15:36:59.384896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-08-08T22:33:20.124926Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-07T15:36:49.317584Z","title":"Towards reasoning era: A survey of long chain- of-thought for reasoning large language models.arXiv preprint arXiv:2503.09567, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:49.317584Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:6b5351adc2e4fc8f95c4c46b9aaef0bfb24ec287e13fe1c64c36cc8f3d7eb060","observation_id":"d5a7cf2f-c2a0-414e-b39f-ef90567747a0","resolution":{"observed_at":"2026-08-07T15:36:49.317584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:49.383928Z","title":"Opencompass: A universal evaluation platform for foundation models.https://github.com/open-compass/opencompass, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:49.383928Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:a9d272f61c418d6aff9a7ab9442c960a9867e659966a05818791e386444103ae","observation_id":"a93a0685-831e-4c90-9a01-795280ab935d","resolution":{"observed_at":"2026-08-07T15:36:49.383928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-07T15:36:49.435775Z","title":"Process reinforcement through implicit rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:49.435775Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:d4ce8384fb572a65ef11f41decb01a57cd005eb919dd6a1b89184eb7eefcde66","observation_id":"a9bafb76-c51d-45d4-a77c-563882fa8f9b","resolution":{"observed_at":"2026-08-07T15:36:49.435775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:58.917907Z","title":null,"venue":null,"work_id":"4e9aeea8-3a8e-46ce-b900-1ef47e97740d","year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:49.535231Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:0f8ca42587345a6c966bc21346a67525746f746c2063a4f9ce747f1d356394b9","observation_id":"668db233-568d-4c5e-b3dc-0008c8606ebf","resolution":{"observed_at":"2026-08-07T15:36:59.080504Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:49.637551Z","title":"Raft: Reward ranked finetuning for generative foundation model alignment, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:49.637551Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:7170dc819a4bdd7b76b184771b9f674722e6954e52d93dfa52858d3782c5eaaa","observation_id":"b9eaf3c8-7c5f-47db-8983-e4f81e3053ce","resolution":{"observed_at":"2026-08-07T15:36:49.637551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-07T15:36:49.712042Z","title":"Length-controlled alpacaeval: A simple way to debias automatic evaluators.arXiv preprint arXiv:2404.04475, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:49.712042Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:e1dda4cd5f594a291ca2e69092d67290b68c43744e6180ff544d5623bf7cc680","observation_id":"106e2374-3c76-46a7-a2d8-63ff106d590a","resolution":{"observed_at":"2026-08-07T15:36:49.712042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:49.802501Z","title":"The language model evaluation harness, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:49.802501Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:0b60fb2a5c34dee151f070a5931809ff4d5c812d911f96aeb550b2416cc63e00","observation_id":"e04a842c-6fb0-46ca-8e4e-5fb1c67cd60f","resolution":{"observed_at":"2026-08-07T15:36:49.802501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:58.530774Z","title":"A survey on llm-as-a-judge, 2025","venue":null,"work_id":"bcdfe0b5-7dcd-4ff9-b4ad-d2797e47c527","year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:49.872918Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:2cdad2b1afc7d7950920523b8546ecdc570adb0efe76b620be17e2aa08f34173","observation_id":"bc96dede-980f-400e-a3bb-297c8eed8dbe","resolution":{"observed_at":"2026-08-07T15:36:58.719702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:36:49.951924Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:49.951924Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:9acea27840bcb3a71d27e324cc1cedfc8fcd1588c41ee8ad0b99f670f255eb18","observation_id":"c20689a6-cd8b-46be-93a5-e00c5012ee25","resolution":{"observed_at":"2026-08-07T15:36:49.951924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T15:36:50.028195Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems.arXiv preprint arXiv:2402.14008, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:50.028195Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:3e7b7644524030088491603756ca4c203205d166050e88e6c5bfb23aed149096","observation_id":"a6eebf7f-88ce-4155-a7f8-24bba27364bf","resolution":{"observed_at":"2026-08-07T15:36:50.028195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:58.280098Z","title":"Ultraeval: A lightweight platform for flexible and comprehensive evaluation for llms, 2024","venue":null,"work_id":"de75ff55-3d6b-498d-861f-2973fc44c615","year":2024},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:50.106985Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:df123ba72ff1bfbc59e0180be016d61a38967a26aa2e20a1ceed3e0d0b3d32a2","observation_id":"de83242f-d66c-4d96-b460-91f78ea5548c","resolution":{"observed_at":"2026-08-07T15:36:58.400339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T15:36:50.175071Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:50.175071Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:945d5af72cb552ca54b741262678a8e64c9fdc65bf691019c418c4d5c541d2d1","observation_id":"78210343-cbd8-436f-822d-24ac91b47ace","resolution":{"observed_at":"2026-08-07T15:36:50.175071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:57.919315Z","title":"Putting rl back in rlhf.https://huggingface","venue":null,"work_id":"d5e874c7-2d90-496b-a467-38345c7dc944","year":2024},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:50.257487Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:979fd3aba5a5685d382f109b809205badab9d4b8515a85e4d350ca4845e0446f","observation_id":"4b835f02-d85b-4a76-97db-17fb968707ef","resolution":{"observed_at":"2026-08-07T15:36:58.082900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:57.586577Z","title":"Math-Verify: A robust mathematical expression evaluation system.https: //github.com/huggingface/Math-Verify, 2025","venue":null,"work_id":"56fbb7ae-ca8e-4946-afea-47c33873087b","year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:50.339116Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:c9994f503716daf720b9f44c5a8ade102ddfe130ee8f94982acc7311740a8102","observation_id":"9218d86e-64e4-4a9a-bb18-ab94f77c0901","resolution":{"observed_at":"2026-08-07T15:36:57.736623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T15:36:50.434833Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:50.434833Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:415b5f95406e2b1017110eeb1e8ccd500e704ad025d7b3bcd677a0fe168ed1c9","observation_id":"a5eab1cc-2a3e-4122-98b2-6576af50da68","resolution":{"observed_at":"2026-08-07T15:36:50.434833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:50.521407Z","title":"Med-r1: Reinforcement learning for generalizable medical reasoning in vision-language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:50.521407Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:fdd0bd44f4f647c37aee822bc0fe299e433b5da2b2392d5d9eb2cdeacb3965e3","observation_id":"c30b3d3b-ea42-4ad3-85a2-3bff7c4554b5","resolution":{"observed_at":"2026-08-07T15:36:50.521407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T15:36:50.636962Z","title":"T\\\" ulu 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:50.636962Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:5106385255b1d50caed86843806feaf7eac23b8cd1292553fc7d933ef39ed87a","observation_id":"0d7f196a-3c6e-4d18-8406-31549108e161","resolution":{"observed_at":"2026-08-07T15:36:50.636962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:57.334120Z","title":"From generation to judgment: Opportunities and challenges of llm-as-a-judge, 2025","venue":null,"work_id":"5cbcb4d1-0c26-4b15-9648-a8744168c8e9","year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:50.743462Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:0cdd5a7a8e650c0ef1a6a5877707be6e21507eb8f93ab7dfcbe6b78bd452b031","observation_id":"9e549583-4066-48f7-ae5a-391be89490b8","resolution":{"observed_at":"2026-08-07T15:36:57.431870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-11T09:34:38.920981Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-07T15:36:50.844232Z","title":"From crowdsourced data to high-quality benchmarks: Arena-hard and benchbuilder pipeline.arXiv preprint arXiv:2406.11939, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:50.844232Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:84b480fb91a8c35765975a14cafc8dfc9698a0ff7994eaffb63e54763989e2ac","observation_id":"13bb5dbb-8698-4c18-b1f0-1141c77c40d6","resolution":{"observed_at":"2026-08-07T15:36:50.844232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:57.052309Z","title":"Hashimoto","venue":null,"work_id":"12cbee5a-5fe3-4107-a4be-d38096cfb1b0","year":2023},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:50.940181Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:1f872e3ca214e04e7c0d2784409c54b173f09ea78db92e8bf9c957a445049091","observation_id":"c4aad93c-cd18-434c-a46d-a22d024f05c5","resolution":{"observed_at":"2026-08-07T15:36:57.166159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:51.077787Z","title":"Wildbench: Benchmarking llms with challenging tasks from real users in the wild, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:51.077787Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:f0e48cb2882452c8d439a5ac3b05da8b8b6409b95efaebe73478eb22c0572484","observation_id":"415006a0-c6c1-4439-971e-a4c733be84f6","resolution":{"observed_at":"2026-08-07T15:36:51.077787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:51.220864Z","title":"Deepscaler: Surpassing o1-preview with a 1.5 b model by scaling rl.Notion Blog, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:51.220864Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:da220fb95fa5ec87ab6b1448ee4b00c541d9cd36787bf5810c2e5329ec8cee06","observation_id":"42cc20b7-78f1-4cc5-8994-39500db0b961","resolution":{"observed_at":"2026-08-07T15:36:51.220864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:56.703246Z","title":"General- reasoner: Advancing llm reasoning across all domains, 2025","venue":null,"work_id":"14fa9e40-42d0-4508-8147-a1033af03de8","year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:51.390548Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:e2b4584bb395ad4440f8512fe15953e40f1b3bd0b1ca12ae5e542b88bc7a9224","observation_id":"a18d1b64-2272-46c8-b00f-40b5de843138","resolution":{"observed_at":"2026-08-07T15:36:56.875421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:56.411226Z","title":"Reinforcement learning with verifiable rewards: Grpo’s effective loss, dy- namics, and success amplification, 2025","venue":null,"work_id":"3df32e49-fd00-4960-8e02-f051c0cc7469","year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:51.532455Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:5d52b13eddfe71ed72a7dab5be61e55162486c12f7c406a56d1c4af20a23bb29","observation_id":"7f77a618-2304-42ac-a8eb-dff87f7c1c3d","resolution":{"observed_at":"2026-08-07T15:36:56.563907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:51.687694Z","title":"s1: Simple test-time scaling, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:51.687694Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:61f3f9a61db7980031f6f3c9b215271525074658925b73b7b09926844135fa32","observation_id":"caee832f-c2f3-47a8-800d-a9ac97acbc47","resolution":{"observed_at":"2026-08-07T15:36:51.687694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:56.264713Z","title":"OpenAI Evals: A framework for evaluating llms.https://github.com/openai/ evals, 2025","venue":null,"work_id":"45c73eaa-1a36-452b-bc6d-5a20b302150e","year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:51.831728Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:132918d1213502f4a1fce6cc1b6e2ed9b7deda1cf05e4e6a6f7f1b1819a86f0f","observation_id":"a6203986-d348-4610-8853-308b98f5ad0d","resolution":{"observed_at":"2026-08-07T15:36:56.331189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:51.982792Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:51.982792Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:eca0d7f0fa6b5b6ddac29f00b0452cfd18e7dbb1fd7f8a483ae65a09d7140ddb","observation_id":"a4639574-c2f7-41c9-b344-6d1c7e8c1cec","resolution":{"observed_at":"2026-08-07T15:36:51.982792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:52.128786Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:52.128786Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:79cba5c2d42d322fc662e6966beef037f16ce89dfcf7ad7548d71bacd417765b","observation_id":"3774910b-089f-4701-b8b2-f7d78db42b96","resolution":{"observed_at":"2026-08-07T15:36:52.128786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T15:36:52.262883Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:52.262883Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:879f1f740e21a636e4b75335415d2c61a270d12ea1f17d3015d9d11b46ef854d","observation_id":"0d82b86b-711b-4e51-8e57-d8c78ff1ee60","resolution":{"observed_at":"2026-08-07T15:36:52.262883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:52.386742Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:52.386742Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:a6738f84a5befcb61a1e05d4772b63a3b63092b8de1c9032a414c228253a21ec","observation_id":"9e882606-ace1-4a33-81e1-dc723e8a65e6","resolution":{"observed_at":"2026-08-07T15:36:52.386742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18449","last_updated":"2025-12-01T00:16:59Z","snapshot_observed_at":"2026-08-13T07:37:18.494967Z","submitted_at":"2025-02-25T18:45:04Z","title":"SWE-RL: Advancing LLM Reasoning via Reinforcement Learning on Open Software Evolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18449","snapshot_observed_at":"2026-08-07T15:36:52.514084Z","title":"Swe-rl: Advancing llm reason- ing via reinforcement learning on open software evolution.arXiv preprint arXiv:2502.18449, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:52.514084Z"},"links":{"cited_paper":"/paper/2502.18449","citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:bd25336ea04a669e317fb2ed6f633a9e7f700935f699605b7d8373855fef88dd","observation_id":"acda1c18-7e8d-4349-b20a-cbfe59c44214","resolution":{"observed_at":"2026-08-07T15:36:52.514084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14333","last_updated":"2024-05-23T09:03:42Z","snapshot_observed_at":"2026-08-13T00:00:48.229211Z","submitted_at":"2024-05-23T09:03:42Z","title":"DeepSeek-Prover: Advancing Theorem Proving in LLMs through Large-Scale Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14333","snapshot_observed_at":"2026-08-07T15:36:52.625163Z","title":"Deepseek-prover: Advancing theorem proving in llms through large- scale synthetic data.arXiv preprint arXiv:2405.14333, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:52.625163Z"},"links":{"cited_paper":"/paper/2405.14333","citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:00950055b52229f77e65447589baa50d1aa7de0b66ad77f873b1a4c5aed9d7c4","observation_id":"3a579662-71a9-4b86-abed-e584b3ee26b8","resolution":{"observed_at":"2026-08-07T15:36:52.625163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:52.715159Z","title":"A minimalist approach to llm reasoning: from rejection sampling to reinforce, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:52.715159Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:2ce7d06064cea6330150ae99515f5b6ab5f58d08ba7311549f4a3ee36b50ffa2","observation_id":"988bea9c-818f-4c1a-9c72-eddf547bbe1f","resolution":{"observed_at":"2026-08-07T15:36:52.715159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13818","last_updated":"2026-04-22T00:26:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-18T17:49:55Z","title":"Not All Rollouts are Useful: Down-Sampling Rollouts in LLM Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13818","snapshot_observed_at":"2026-08-07T15:36:52.916366Z","title":"Not all rollouts are useful: Down- sampling rollouts in llm reinforcement learning.arXiv preprint arXiv:2504.13818, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:52.916366Z"},"links":{"cited_paper":"/paper/2504.13818","citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:47065cfe7308694d4ce9ae99e05e6d6917f649ccc4056f435f210136ab1ed289","observation_id":"b8f4181c-2265-483b-8555-2bfc748af162","resolution":{"observed_at":"2026-08-07T15:36:52.916366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:53.097735Z","title":"Qwen2.5-math technical report: Toward mathematical expert model via self-improvement, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:53.097735Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:c6166ba2af68d9d7f900a87b66f8abcae96b58c3c73b581c043ad8a048483388","observation_id":"5bb1a502-39cc-45e2-8769-3041624abbf4","resolution":{"observed_at":"2026-08-07T15:36:53.097735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:53.220799Z","title":"Limo: Less is more for reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:53.220799Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:51aad0c8fe9e09929231b46470f9a331841b6ad2cb7bbf4ac0f89279ee22b449","observation_id":"31866f05-745b-428c-85b5-d350a798a339","resolution":{"observed_at":"2026-08-07T15:36:53.220799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:53.453264Z","title":"Dapo: An open-source llm reinforcement learning system at scale, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:53.453264Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:22aeab0696d249cd5d32480830895c1f5150aa40c9acfb2d302f84da5b7e9559","observation_id":"c960e078-d3cb-4cf8-a455-d4dc2fb840e4","resolution":{"observed_at":"2026-08-07T15:36:53.453264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05118","last_updated":"2025-04-11T02:54:58Z","snapshot_observed_at":"2026-08-14T16:01:52.772456Z","submitted_at":"2025-04-07T14:21:11Z","title":"VAPO: Efficient and Reliable Reinforcement Learning for Advanced Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05118","snapshot_observed_at":"2026-08-07T15:36:53.603007Z","title":"Vapo: Efficient and reliable rein- forcement learning for advanced reasoning tasks.arXiv preprint arXiv:2504.05118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:53.603007Z"},"links":{"cited_paper":"/paper/2504.05118","citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:c2d36c2b30269850de965b3213986c021057a4499de523c882762aee4c8b6a82","observation_id":"f78eea0f-e438-4e9a-bad1-a1df752bc050","resolution":{"observed_at":"2026-08-07T15:36:53.603007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:53.787633Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:53.787633Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:80eeffc0fff9880adf963e427fde056619a597e274f5d23d6aa34a47042efeb0","observation_id":"70534c50-af02-4c81-ae12-951af34c4ea8","resolution":{"observed_at":"2026-08-07T15:36:53.787633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T15:36:53.974048Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild.arXiv preprint arXiv:2503.18892, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:53.974048Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:c338c45ede34cce17092da13946889726bba75ef99059c678f70e9f1c12554cc","observation_id":"65631411-b382-47d5-9dff-0ec989593bd8","resolution":{"observed_at":"2026-08-07T15:36:53.974048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:55.914239Z","title":"LLM as a judge","venue":null,"work_id":"3ee79166-409e-4811-b2e3-85f155f92780","year":2024},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:54.177987Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:f7b24c0e7221f449925a5dccce5cd07637426abd73ac3968656b915096a7dd1c","observation_id":"6d0567c8-dec6-4884-aa07-53b613d8ee30","resolution":{"observed_at":"2026-08-07T15:36:56.054865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:55.647486Z","title":null,"venue":null,"work_id":"6e276863-57d0-49ee-819d-3a927c081362","year":null},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:54.297538Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:c7fa7acb5c195064daf11d33a9ff7cc1b0f6f6b33806cb9e220b2a549b590f0e","observation_id":"9bed4c2a-33a8-443c-b0df-f3edfdac91f6","resolution":{"observed_at":"2026-08-07T15:36:55.783306Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:55.398326Z","title":null,"venue":null,"work_id":"bd375e13-5440-40e8-a763-040a1efce7f3","year":null},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:54.447166Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:3b90d4888b9919f641b143e6d601cbb30b0d39bbe9c20b25e8e15f815706f936","observation_id":"3a1be238-ee3e-4a3c-a577-be0e0032c2c9","resolution":{"observed_at":"2026-08-07T15:36:55.515728Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:36:55.101557Z","title":"reasoning","venue":null,"work_id":"4397a5dc-48d7-4117-861c-6e2573e2bced","year":null},"citing_paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:54.555335Z"},"links":{"citing_paper":"/paper/2505.14625"},"observation_digest":"sha256:89d2a9893af148a084b2dbf7edcef7ec1ab6784cf965a4d8752ff1d0b67e8d11","observation_id":"1413de55-c728-4406-9901-d4215721e8a8","resolution":{"observed_at":"2026-08-07T15:36:55.233979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.14625","last_updated":"2025-05-22T17:49:50Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T03:49:10.492607Z","submitted_at":"2025-05-20T17:16:44Z","title":"TinyV: Reducing False Negatives in Verification Improves RL for LLM Reasoning"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 8 inbound Pith citation observations for arXiv:2505.14625."}