{"as_of":"2026-08-10T13:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8fe7a541ef399ea5959118e22f38b1e9dcdb57b53be835c2ad56bf95015d8623","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:00:04.018651Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":15,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:35:23.466690Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:09:43.563954Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-08-06T23:35:23.466690Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17219","last_updated":"2025-06-25T13:27:49Z","snapshot_observed_at":"2026-08-07T08:57:51.827843Z","submitted_at":"2025-06-20T17:59:52Z","title":"No Free Lunch: Rethinking Internal Feedback for LLM Reasoning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T23:35:23.466690Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2506.17219"},"observation_digest":"sha256:b984b33157f94fab70d668536eb814658eb18df95e06134b0774e4eec8da1114","observation_id":"4c754fc7-8981-4231-aa49-bfa42e2afe9a","resolution":{"observed_at":"2026-08-06T23:35:23.466690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-08-06T22:45:11.016827Z","title":"One-shot Entropy Minimization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20877","last_updated":"2025-06-25T22:59:40Z","snapshot_observed_at":"2026-08-09T14:27:40.123447Z","submitted_at":"2025-06-25T22:59:40Z","title":"THIRDEYE: Cue-Aware Monocular Depth Estimation via Brain-Inspired Multi-Stage Fusion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:45:11.016827Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2506.20877"},"observation_digest":"sha256:41fa103cf959abe9dcd66def3b7b7e68da7434339811de80048e94bb30df50cf","observation_id":"881e88db-a251-40ce-9704-853b60289a18","resolution":{"observed_at":"2026-08-06T22:45:11.016827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-08-06T12:26:11.136900Z","title":"arXiv preprint arXiv:2505.20282","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.21848","last_updated":"2025-07-29T14:23:58Z","snapshot_observed_at":"2026-08-07T09:00:21.482682Z","submitted_at":"2025-07-29T14:23:58Z","title":"EDGE-GRPO: Entropy-Driven GRPO with Guided Error Correction for Advantage Diversity","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T12:26:11.136900Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2507.21848"},"observation_digest":"sha256:e4343fdd7fc97cbb0c28ff45b39d097174056d0343eb11dd2209ab14fa056e15","observation_id":"43d43ab2-3aa5-49da-8317-3a3b660ecc44","resolution":{"observed_at":"2026-08-06T12:26:11.136900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-08-05T14:23:53.913129Z","title":"One-shot entropy minimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00125","last_updated":"2025-08-29T08:57:54Z","snapshot_observed_at":"2026-08-09T10:28:40.663929Z","submitted_at":"2025-08-29T08:57:54Z","title":"Know When to Explore: Difficulty-Aware Certainty as a Guide for LLM Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T14:23:53.913129Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2509.00125"},"observation_digest":"sha256:6ab77dd5d0748b4001573da6f9eaadd6f04dd1c1c643edbb01b2e18a281f838e","observation_id":"72352bc2-0201-46b3-9b37-71dd8e686483","resolution":{"observed_at":"2026-08-05T14:23:53.913129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-08-04T19:28:56.841114Z","title":"One-shot entropy minimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09265","last_updated":"2025-09-11T08:50:01Z","snapshot_observed_at":"2026-08-08T10:27:53.369430Z","submitted_at":"2025-09-11T08:50:01Z","title":"Harnessing Uncertainty: Entropy-Modulated Policy Gradients for Long-Horizon LLM Agents","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T19:28:56.841114Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2509.09265"},"observation_digest":"sha256:fb5c689d5fd71dd013e7f6ab14a940308175be893c25fada89715e78c18697de","observation_id":"596ef3ac-f757-494c-88ad-d727917f3bec","resolution":{"observed_at":"2026-08-04T19:28:56.841114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":"2505.20282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-04T09:09:43.563954Z","title":"One-shot entropy minimization.arXiv preprint arXiv:2505.20282","venue":null,"work_id":"5336276b-09e9-4d0a-8cce-c6e5dde7e628","year":2025},"citing_paper":{"arxiv_id":"2509.14234","last_updated":"2026-05-09T12:06:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-17T17:59:42Z","title":"Compute as Teacher: Turning Inference Compute Into Reference-Free Supervision","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T15:45:09.730804Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2509.14234"},"observation_digest":"sha256:b50d9610cc288707b0967bad1c7f7082df64b920441f3be28d60f718d4eb2b45","observation_id":"a7bad3a1-dcca-4979-b003-a142e7a21adb","resolution":{"observed_at":"2026-05-18T15:46:34.108283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-14T20:22:12.729190Z","title":"org/CorpusID:275789950","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.18375","last_updated":"2026-07-10T23:41:27Z","snapshot_observed_at":"2026-08-07T22:46:43.471693Z","submitted_at":"2026-03-19T00:23:57Z","title":"Relationship-Centered Care: Relatedness and Responsible Design for Human Connections in Mental-Health Care","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T20:22:12.729190Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2603.18375"},"observation_digest":"sha256:ee886d5cffad4684d1072c844d32e7e7a4af7609d4bf7c92dc155900dfcb536a","observation_id":"a46c5b96-f8c7-43b3-9750-91915ed0bcb5","resolution":{"observed_at":"2026-07-14T20:22:12.729190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":"2505.20282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-04T09:09:43.563954Z","title":"One-shot entropy minimization.arXiv preprint arXiv:2505.20282","venue":null,"work_id":"5336276b-09e9-4d0a-8cce-c6e5dde7e628","year":2025},"citing_paper":{"arxiv_id":"2604.12736","last_updated":"2026-04-14T13:50:31Z","snapshot_observed_at":"2026-07-06T23:00:51.385974Z","submitted_at":"2026-04-14T13:50:31Z","title":"Token-Level Policy Optimization: Linking Group-Level Rewards to Token-Level Aggregation via Sequence-Level Likelihood","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:00.241691Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2604.12736"},"observation_digest":"sha256:4753d8aeebde762adfe30dd7084245b70fb476a11c898f7833181aae6f338027","observation_id":"dc6f50a1-32fc-443c-b4c0-78c4f578d803","resolution":{"observed_at":"2026-05-11T10:41:04.634441Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":"2505.20282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-04T09:09:43.563954Z","title":"One-shot entropy minimization.arXiv preprint arXiv:2505.20282","venue":null,"work_id":"5336276b-09e9-4d0a-8cce-c6e5dde7e628","year":2025},"citing_paper":{"arxiv_id":"2604.17928","last_updated":"2026-04-20T08:09:01Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T08:09:01Z","title":"HEALing Entropy Collapse: Enhancing Exploration in Few-Shot RLVR via Hybrid-Domain Entropy Dynamics Alignment","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-10T05:23:08.478393Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2604.17928"},"observation_digest":"sha256:3bc26c4a770edd11c489db5e89ff713b46b372b032b3c6643ef9bd804b462516","observation_id":"17991fc5-8074-4b24-a417-d2f1b8ae79ab","resolution":{"observed_at":"2026-05-10T05:25:55.218273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":"2505.20282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-04T09:09:43.563954Z","title":"One-shot entropy minimization.arXiv preprint arXiv:2505.20282","venue":null,"work_id":"5336276b-09e9-4d0a-8cce-c6e5dde7e628","year":2025},"citing_paper":{"arxiv_id":"2604.18003","last_updated":"2026-04-20T09:27:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T09:27:40Z","title":"SELF-EMO: Emotional Self-Evolution from Recognition to Consistent Expression","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T05:04:04.941107Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2604.18003"},"observation_digest":"sha256:b71ed30ed42d5c334061eb13bd6398b6421e2dc3452e780bba6636d9fc0e2a6b","observation_id":"57adcbe9-771a-4d1f-8176-6e58f1eeb267","resolution":{"observed_at":"2026-05-10T10:09:08.620767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":"2505.20282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-04T09:09:43.563954Z","title":"One-shot entropy minimization.arXiv preprint arXiv:2505.20282","venue":null,"work_id":"5336276b-09e9-4d0a-8cce-c6e5dde7e628","year":2025},"citing_paper":{"arxiv_id":"2604.19295","last_updated":"2026-04-21T10:01:04Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T10:01:04Z","title":"TEMPO: Scaling Test-time Training for Large Reasoning Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T02:40:04.086809Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2604.19295"},"observation_digest":"sha256:344956c893d65bb99746da5f392f1d72bbb14e90718fc6bede10dbe3c0749803","observation_id":"491ffeb3-5399-4d0a-bdba-ec7b8e9fc6ed","resolution":{"observed_at":"2026-05-11T12:51:07.240388Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":"2505.20282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-04T09:09:43.563954Z","title":"One-shot entropy minimization.arXiv preprint arXiv:2505.20282","venue":null,"work_id":"5336276b-09e9-4d0a-8cce-c6e5dde7e628","year":2025},"citing_paper":{"arxiv_id":"2605.07244","last_updated":"2026-05-08T05:01:40Z","snapshot_observed_at":"2026-08-09T17:46:54.267669Z","submitted_at":"2026-05-08T05:01:40Z","title":"Experience Sharing in Mutual Reinforcement Learning for Heterogeneous Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-11T02:02:41.411795Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2605.07244"},"observation_digest":"sha256:67046e690be5da57b9dadb1cd70405ed46738631f2e6bf979f99fc4644f6fddf","observation_id":"9f6b2ece-7564-4e72-b83b-32db22f1f6b5","resolution":{"observed_at":"2026-05-11T04:00:55.342799Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":"2505.20282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-04T09:09:43.563954Z","title":"One-shot entropy minimization.arXiv preprint arXiv:2505.20282","venue":null,"work_id":"5336276b-09e9-4d0a-8cce-c6e5dde7e628","year":2025},"citing_paper":{"arxiv_id":"2605.08186","last_updated":"2026-05-05T12:00:06Z","snapshot_observed_at":"2026-08-02T05:15:18.309649Z","submitted_at":"2026-05-05T12:00:06Z","title":"Rethinking Entropy Minimization in Test-Time Adaptation for Autoregressive Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T00:48:47.213681Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2605.08186"},"observation_digest":"sha256:703102c0aa0c4d66d630b3c0eca65027d218ec8fceb5f7177b40aa1e5af1ed5f","observation_id":"51ef5662-03e5-464b-941a-6202a389d6f2","resolution":{"observed_at":"2026-05-12T08:41:24.673769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":"2505.20282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-04T09:09:43.563954Z","title":"One-shot entropy minimization.arXiv preprint arXiv:2505.20282","venue":null,"work_id":"5336276b-09e9-4d0a-8cce-c6e5dde7e628","year":2025},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":240,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:30a5780eaf27bdcfc26b90abd05abca02f3cc03e85980a38dea126bac81d595b","observation_id":"435b3f76-3273-44d9-9e93-76bbb75d8a1d","resolution":{"observed_at":"2026-07-01T20:56:13.355560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"cited_work":{"arxiv_id":"2505.20282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20282","snapshot_observed_at":"2026-07-04T09:09:43.563954Z","title":"One-shot entropy minimization.arXiv preprint arXiv:2505.20282","venue":null,"work_id":"5336276b-09e9-4d0a-8cce-c6e5dde7e628","year":2025},"citing_paper":{"arxiv_id":"2606.22570","last_updated":"2026-06-21T16:14:46Z","snapshot_observed_at":"2026-08-05T07:45:25.638269Z","submitted_at":"2026-06-21T16:14:46Z","title":"What are Key Factors for Updates in RL for LLM Reasoning?","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-26T10:24:53.245739Z"},"links":{"cited_paper":"/paper/2505.20282","citing_paper":"/paper/2606.22570"},"observation_digest":"sha256:4d1d6bdcda1c391c5b7d6da8bb95deb72916a9f42c2dc59c7c61f99d01d64cf7","observation_id":"2b142ae2-05d1-4a9e-bfb1-53ef1010a7c4","resolution":{"observed_at":"2026-07-04T09:09:43.565648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.20282/citation-record","integrity":"/paper/2505.20282/integrity","json":"/paper/2505.20282/citation-record.json","paper":"/paper/2505.20282"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:00.965336Z","title":"The unreasonable effectiveness of entropy minimization in llm reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:00.965336Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:a1c37591c11201f0b5e18a50afef11756d3abe1a9144b009dd46c8971d496a4b","observation_id":"c684cd86-0491-4eb8-95fb-bb4a6ab2d7f6","resolution":{"observed_at":"2026-08-07T14:00:00.965336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:00.986064Z","title":"Program synthesis with large language models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:00.986064Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:ee253282bfcaf91f44698dfa1f10eb1d93cfadd5fdd14565ef3c15c95df44837","observation_id":"e4a3f193-0cf9-4bdc-ba4e-988585ab6de8","resolution":{"observed_at":"2026-08-07T14:00:00.986064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:05.726587Z","title":"Michaud, Jacob Pfau, Dmitrii Krasheninnikov, Xin Chen, Lauro Langosco, Peter Hase, Erdem Bıyık, Anca Dragan, David Krueger, Dorsa Sadigh, and Dylan Hadfield-Menell","venue":null,"work_id":"1fb5d2ce-56ef-47bf-b765-978b8d10353a","year":2023},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.054806Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:d7a687e0945e6c7d470c039b025ee0d6684bd89c2465fecda44717952f78acfb","observation_id":"a95a396f-dea4-4c46-8a22-0230835b0dfd","resolution":{"observed_at":"2026-08-07T14:00:05.839135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:01.102138Z","title":"Process reinforcement through implicit rewards, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.102138Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:b9a07a7a51ac18321eb8ee5c7851ae369aee45b113c1c382cddbba84ce555eeb","observation_id":"3a07bc81-2a6e-4ab0-a5c0-8198cdafe87c","resolution":{"observed_at":"2026-08-07T14:00:01.102138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:05.426876Z","title":null,"venue":null,"work_id":"e2954a41-21e2-44d9-8316-e910b9af749e","year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.166182Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:cee1fc1509c3bf942adb1696f3755d65fae15d7a6896a1d6fdadc5742587ee0b","observation_id":"42dda982-470f-4c9b-bf9d-4992cc052fbe","resolution":{"observed_at":"2026-08-07T14:00:05.556666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:01.245249Z","title":"Interpretable contrastive monte carlo tree search reasoning, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.245249Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:0446dc1d9f5bfd9c2d57ebe48a999325d9925c1658eda73afca8b3f3b89a9916","observation_id":"b8dc0b44-98dc-4fbe-9f3a-6c8f2bb0741b","resolution":{"observed_at":"2026-08-07T14:00:01.245249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:05.155756Z","title":"Mixed preference optimization: Reinforcement learning with data selection and better reference model, 2025","venue":null,"work_id":"ed698b90-86e3-4074-bdb7-f2f208ad5f94","year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.280847Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:41463d55151d72924063b48afc7b5702444932ed6cffa69812229be42678783e","observation_id":"e67606fe-d368-43d6-818f-14ece745f27c","resolution":{"observed_at":"2026-08-07T14:00:05.254551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:01.363469Z","title":"Accelerate: Training and inference at scale made simple, efficient and adaptable","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.363469Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:dbfb8e630adb9fd772da93660860ec85909354449d773ee33cf8ad6f849e71e7","observation_id":"6fec6666-3639-4126-b301-2700ec07e3c8","resolution":{"observed_at":"2026-08-07T14:00:01.363469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:01.426637Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.426637Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:36977ca9f9399c3be34f74673a480d316b917cfc2c4a2480ad7686b258aab253","observation_id":"9766c71c-6604-4d11-b589-0736c0a59b0d","resolution":{"observed_at":"2026-08-07T14:00:01.426637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:01.545993Z","title":"Reinforce++: A simple and efficient approach for aligning large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.545993Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:e4af0678a0eeb4f2b8856f073afcc6e21a8c777bb6ecf148df26c449a6b37b3f","observation_id":"8b922226-020b-40e3-9e93-c9e6b7e53bb6","resolution":{"observed_at":"2026-08-07T14:00:01.545993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:01.668419Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.668419Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:6111f59c271173791d8586d3cb8394bf1ddc2204b4ddbf5ca90451111c92da80","observation_id":"b765e25c-b272-4d62-9c67-623b504bcdb9","resolution":{"observed_at":"2026-08-07T14:00:01.668419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:01.772374Z","title":"Solving quantitative reasoning problems with language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.772374Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:eedd09902721ff6a498867c5644a03cdf3294b3415c356fc4b24d7f5e99354e4","observation_id":"b39f15ba-6895-4345-9b8d-2d6431c914e6","resolution":{"observed_at":"2026-08-07T14:00:01.772374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:01.861831Z","title":"Numinamath","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.861831Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:a333d42cbbddb1bf81e701d5dbc69e5559a242bf0ddff7440e33193b018f6289","observation_id":"9f8531b7-91ad-4f83-b3c8-f6b0ee3fd4d2","resolution":{"observed_at":"2026-08-07T14:00:01.861831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T14:00:01.988637Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:01.988637Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:d2471844b3370d16ce58ed376f18cfad1aef6c15922c6de9a6a71c372379cbc8","observation_id":"f2137447-de90-4943-8098-d810c46ec7d6","resolution":{"observed_at":"2026-08-07T14:00:01.988637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:02.104088Z","title":"Understanding r1-zero-like training: A critical perspective, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.104088Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:22243b774d1e4888b81c5a301f74468521d255460774321fa4e317a8bb6ce452","observation_id":"63073ceb-54a4-4927-a2a8-6e3ba697d05e","resolution":{"observed_at":"2026-08-07T14:00:02.104088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:02.257146Z","title":"Introducing openai o1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.257146Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:6a0c11333a5de712a83141e50bf71f4036272723a403396e241b1994933fe6c0","observation_id":"c0f32483-2e78-480e-a2f4-719cada52967","resolution":{"observed_at":"2026-08-07T14:00:02.257146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:04.804928Z","title":"Introducing openai o3 and o4-mini, April 2025","venue":null,"work_id":"0b978bbf-6b94-4bc8-abdf-4bb172eba311","year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.379106Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:6d441d98a673129ed3db4f23f7c85144d62b96a0d4543e6f1f2bb73d1fdfcbec","observation_id":"b58c0e40-63af-46ee-b959-f8d146d415fd","resolution":{"observed_at":"2026-08-07T14:00:04.958398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:02.516302Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.516302Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:ba974bbce3632c17da514cb3b5dd6f3a04011206ff3467263a185cc05a607359","observation_id":"d6b42aab-48a4-4a57-be82-b52df24a7b10","resolution":{"observed_at":"2026-08-07T14:00:02.516302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:02.670448Z","title":"Lee, and Sanjeev Arora","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.670448Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:cf1c6394e9e7f35db2c237e9e8d1386f109b3aa8fcb8c2f6b9db9782d1a6ccaf","observation_id":"99dc841e-745d-43eb-acbc-cfe6b83a565e","resolution":{"observed_at":"2026-08-07T14:00:02.670448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:02.783413Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.783413Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:c6c22843d810978b1e410d6983d869d65a9d3d3bf47a0fa60456a307a99186e0","observation_id":"4a49c8fb-eee5-461b-8ace-0d3b6a0d57ff","resolution":{"observed_at":"2026-08-07T14:00:02.783413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:02.976908Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:02.976908Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:de8d92c7b2fbedd134cfcc6024e2f1522e7bc847c8c3e98050d11db0534e28d7","observation_id":"380c4873-a384-4d53-9d23-33dd185fb90b","resolution":{"observed_at":"2026-08-07T14:00:02.976908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:03.163516Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.163516Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:0239981d25d19c64bd00e83be02350f7b57765f9a4bd425e45717f54f7365982","observation_id":"50cb3015-10f7-4dde-984a-962aa8ba4b5a","resolution":{"observed_at":"2026-08-07T14:00:03.163516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:03.293586Z","title":"Reinforcement learning for reasoning in large language models with one training example, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.293586Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:02c44ec73479068ee14428ff8a7997eacfd1966cf5857cd2622fb44261bb7a7a","observation_id":"5cbfd56f-65c5-4494-90dc-7a97648f838f","resolution":{"observed_at":"2026-08-07T14:00:03.293586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:04.474091Z","title":"On memorization of large language models in logical reasoning","venue":null,"work_id":"728d79a3-8bea-4b82-ae14-31fde5eb5adf","year":2024},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.410913Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:9930d110fb45b7fd26d73c1080ce60aabbf5a18ad9b7d7e84f83451cb189855a","observation_id":"27853730-a5ce-4d70-8821-b5b49ea5b3d4","resolution":{"observed_at":"2026-08-07T14:00:04.618222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:03.557524Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.557524Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:2da6c6a62a968dacc112671998d122dbc239f6ddd38d2839ea53e277d4e4c59e","observation_id":"3956a355-01cf-4690-a333-cc63d9648b98","resolution":{"observed_at":"2026-08-07T14:00:03.557524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:03.743721Z","title":"Towards large reasoning models: A survey of reinforced reasoning with large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.743721Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:3de98d19390391ac162aa16be29ad38be6fec45a42abfc6479509e3e5345e4b6","observation_id":"07c8ef16-87cf-44af-9b98-0391ea31b4c0","resolution":{"observed_at":"2026-08-07T14:00:03.743721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:03.880396Z","title":"Redstar: Does scaling long-cot data unlock better slow-reasoning systems?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:03.880396Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:bd64111086f6fd7a99cad872b25b2771313bb20d2153e95960a4ec7a0fd75d2d","observation_id":"d6dc3434-764f-4e1c-a924-052e782cbb49","resolution":{"observed_at":"2026-08-07T14:00:03.880396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:00:04.203932Z","title":"Simplerl-zoo: Investigating and taming zero reinforcement learning for open base models in the wild, 2025","venue":null,"work_id":"dc23545e-318f-45ac-9be1-6edf232c4e6b","year":2025},"citing_paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:04.018651Z"},"links":{"citing_paper":"/paper/2505.20282"},"observation_digest":"sha256:200c3283a943a1f05ce4afcd0696eb260f81e4cc73fc517999bf63966c6d3cfe","observation_id":"a6f37e15-a6d9-4694-9d98-8a9b0357e692","resolution":{"observed_at":"2026-08-07T14:00:04.302387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20282","last_updated":"2025-08-21T08:51:49Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T15:50:07.122819Z","submitted_at":"2025-05-26T17:58:30Z","title":"One-shot Entropy Minimization"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 15 inbound Pith citation observations for arXiv:2505.20282."}