{"as_of":"2026-08-09T16:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0affdd27eac8495025607d99d524b30d17e7a67be66ef7299085ce9334e5eef3","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:31:02.541976Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T10:49:46.153282Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-08T02:48:45.856608Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-08-07T11:31:02.541976Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02355","last_updated":"2025-06-20T04:14:47Z","snapshot_observed_at":"2026-08-08T15:13:20.527982Z","submitted_at":"2025-06-03T01:15:15Z","title":"Rewarding the Unlikely: Lifting GRPO Beyond Distribution Sharpening","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:31:02.541976Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2506.02355"},"observation_digest":"sha256:1fbdf1e12ca27cf7052d4811a558d855f8282b8c6b70f55a7c017f0626b1470e","observation_id":"7adeef12-ffdc-4e0e-8f99-e1f659d5405b","resolution":{"observed_at":"2026-08-07T11:31:02.541976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-08T02:48:45.856608Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-08-06T21:13:13.002002Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00711","last_updated":"2025-07-01T12:14:22Z","snapshot_observed_at":"2026-08-07T07:21:03.621965Z","submitted_at":"2025-07-01T12:14:22Z","title":"Large Reasoning Models are not thinking straight: on the unreliability of thinking trajectories","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:13.002002Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2507.00711"},"observation_digest":"sha256:475d985dc2353a4835062a1b91f4110f51e47114ddb95fd0da97ee05f64b401a","observation_id":"a5a03000-ddb6-4db8-a58a-639361ea3c9c","resolution":{"observed_at":"2026-08-06T21:13:13.002002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-08T02:48:45.856608Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-08-06T17:52:01.663454Z","title":"org/abs/2503.19595","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10616","last_updated":"2025-07-25T11:09:53Z","snapshot_observed_at":"2026-08-06T17:46:01.198994Z","submitted_at":"2025-07-13T19:04:17Z","title":"Scalpel vs. Hammer: GRPO Amplifies Existing Capabilities, SFT Replaces Them","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:52:01.663454Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2507.10616"},"observation_digest":"sha256:ce7c282dc6373b0f0710c10c92f59123fa7c34542452fb2e8579299f8a6e10bd","observation_id":"dc56e706-31a6-4160-9c14-1dbfeae88be1","resolution":{"observed_at":"2026-08-06T17:52:01.663454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-08T02:48:45.856608Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-08-05T20:21:08.184900Z","title":"Optimizing language models for inference time objectives using reinforcement learning.CoRR, abs/2503.19595, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-07T12:11:52.874985Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.184900Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:c717ec52168a27558c6c432b90b5106439adaaa562fc74a1c8f17a1877b1d1ff","observation_id":"8e997e85-8055-440b-a0ec-1515799f464c","resolution":{"observed_at":"2026-08-05T20:21:08.184900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-08T02:48:45.856608Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-08-04T22:59:14.565055Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.565055Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:517d1c4e4795a334a2528ec2898e2b66c93ff60c611f2fd4880c25ee453a8829","observation_id":"0d78bad3-7a1d-4923-8247-095ae001384d","resolution":{"observed_at":"2026-08-04T22:59:14.565055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-08T02:48:45.856608Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.19595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-07-04T10:49:46.153282Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595","venue":null,"work_id":"34d6ecab-e139-48b3-83be-df2b136c6188","year":2025},"citing_paper":{"arxiv_id":"2509.25424","last_updated":"2026-05-03T20:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-29T19:32:11Z","title":"Polychromic Objectives for Reinforcement Learning","version":6},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T11:54:29.955833Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2509.25424"},"observation_digest":"sha256:82fbc0a0f3045f3103c0462df9b144fcd91dae33f4664a9d28a7778c622e7501","observation_id":"d88b1852-3a90-4dcb-bae8-f1db68cd280a","resolution":{"observed_at":"2026-05-18T11:56:19.949595Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-08T02:48:45.856608Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.19595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-07-04T10:49:46.153282Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595","venue":null,"work_id":"34d6ecab-e139-48b3-83be-df2b136c6188","year":2025},"citing_paper":{"arxiv_id":"2604.24957","last_updated":"2026-05-19T21:17:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T19:52:38Z","title":"Compute Aligned Training: Optimizing for Test Time Inference","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T04:12:53.868648Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2604.24957"},"observation_digest":"sha256:1f6166c9e89648d93037403751e3b836dea14dbbb066dbd0fe210a1b4b632bde","observation_id":"2a0054f3-e5f2-4003-b4dd-a3e9efec7692","resolution":{"observed_at":"2026-05-11T21:51:11.736090Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-08T02:48:45.856608Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.19595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-07-04T10:49:46.153282Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595","venue":null,"work_id":"34d6ecab-e139-48b3-83be-df2b136c6188","year":2025},"citing_paper":{"arxiv_id":"2604.24957","last_updated":"2026-05-19T21:17:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-27T19:52:38Z","title":"Compute Aligned Training: Optimizing for Test Time Inference","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T08:41:49.623026Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2604.24957"},"observation_digest":"sha256:1a0beb9b7f810a0cc46eb229fe676c377f363151f99ccc1893e00b4bf21c29c7","observation_id":"05744ee3-eb1e-4fbe-a30f-504c9100dca0","resolution":{"observed_at":"2026-05-21T08:44:04.622393Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-08T02:48:45.856608Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.19595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-07-04T10:49:46.153282Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595","venue":null,"work_id":"34d6ecab-e139-48b3-83be-df2b136c6188","year":2025},"citing_paper":{"arxiv_id":"2605.10716","last_updated":"2026-05-11T15:25:29Z","snapshot_observed_at":"2026-07-06T23:22:37.355450Z","submitted_at":"2026-05-11T15:25:29Z","title":"What should post-training optimize? A test-time scaling law perspective","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T05:20:18.754351Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2605.10716"},"observation_digest":"sha256:1791ebc87c726aaa9d648a7dc3fd3f84d8adb5e64ae825c322db90e3d63d20b0","observation_id":"be2fa0bb-81f2-437a-a626-b5ae1935083e","resolution":{"observed_at":"2026-05-12T05:21:23.886212Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-08T02:48:45.856608Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.19595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-07-04T10:49:46.153282Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595","venue":null,"work_id":"34d6ecab-e139-48b3-83be-df2b136c6188","year":2025},"citing_paper":{"arxiv_id":"2605.20854","last_updated":"2026-05-30T15:59:38Z","snapshot_observed_at":"2026-07-06T23:31:23.407780Z","submitted_at":"2026-05-20T07:44:43Z","title":"Finite-Time Regret Analysis of Retry-Aware Bandits","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T06:01:17.988127Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2605.20854"},"observation_digest":"sha256:0dd42632f830dbdfd85a49bacb58f51a4a5e95fb01d655c8ea1580141127353f","observation_id":"4bdf7ce1-4a7e-44ec-a1fb-7202912bab31","resolution":{"observed_at":"2026-05-21T06:03:59.243572Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-08T02:48:45.856608Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.19595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-07-04T10:49:46.153282Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595","venue":null,"work_id":"34d6ecab-e139-48b3-83be-df2b136c6188","year":2025},"citing_paper":{"arxiv_id":"2606.18910","last_updated":"2026-06-17T10:37:23Z","snapshot_observed_at":"2026-08-02T21:25:42.997753Z","submitted_at":"2026-06-17T10:37:23Z","title":"REVES: REvision and VErification--Augmented Training for Test-Time Scaling","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-26T21:14:15.337979Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2606.18910"},"observation_digest":"sha256:eeb7529a7bb93d20e9d73e4d1b78148a3bf385ee715a24f03b6551ba003537fe","observation_id":"21aa595f-745b-4e8d-88c1-dd996626182f","resolution":{"observed_at":"2026-07-04T00:29:15.155048Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-08T02:48:45.856608Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.19595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-07-04T10:49:46.153282Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595","venue":null,"work_id":"34d6ecab-e139-48b3-83be-df2b136c6188","year":2025},"citing_paper":{"arxiv_id":"2606.23595","last_updated":"2026-06-22T17:02:09Z","snapshot_observed_at":"2026-08-02T13:00:59.578833Z","submitted_at":"2026-06-22T17:02:09Z","title":"SPIRAL: Learning to Search and Aggregate","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-26T08:29:22.303745Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2606.23595"},"observation_digest":"sha256:51acd3135a1320320c4f3c4cf221e2cef7ee7ad3666347e6240869798d0f80a8","observation_id":"448581c1-4c99-47da-9b30-d6f176b30e11","resolution":{"observed_at":"2026-07-04T10:49:46.154935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-08T02:48:45.856608Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.19595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-07-04T10:49:46.153282Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595","venue":null,"work_id":"34d6ecab-e139-48b3-83be-df2b136c6188","year":2025},"citing_paper":{"arxiv_id":"2607.01490","last_updated":"2026-07-01T21:39:19Z","snapshot_observed_at":"2026-08-07T23:25:45.641736Z","submitted_at":"2026-07-01T21:39:19Z","title":"Don't Let Gains FADE: Breaking Down Policy Gradient Weights in RL","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-03T20:59:57.539909Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2607.01490"},"observation_digest":"sha256:62556997dc16690ec6a41048b95af9c55dd18fd5af3a1673393910796adad80f","observation_id":"8b568f87-3394-4b10-8ef4-3182ee70016c","resolution":{"observed_at":"2026-07-03T21:08:57.761591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","snapshot_observed_at":"2026-08-08T02:48:45.856608Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.19595","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19595","snapshot_observed_at":"2026-07-04T10:49:46.153282Z","title":"Optimizing language models for inference time objectives using reinforcement learning.arXiv preprint arXiv:2503.19595","venue":null,"work_id":"34d6ecab-e139-48b3-83be-df2b136c6188","year":2025},"citing_paper":{"arxiv_id":"2607.02390","last_updated":"2026-07-02T16:25:10Z","snapshot_observed_at":"2026-08-03T00:49:51.748486Z","submitted_at":"2026-07-02T16:25:10Z","title":"DecompRL: Solving Harder Problems by Learning Modular Code Generation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-03T16:30:34.793328Z"},"links":{"cited_paper":"/paper/2503.19595","citing_paper":"/paper/2607.02390"},"observation_digest":"sha256:32c637bb8e7d77f5740098d96788e0efda9a4058984cdc363405df838a2dbc27","observation_id":"77e2b571-845e-4398-8209-3bd9b587979a","resolution":{"observed_at":"2026-07-03T16:38:39.754675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2503.19595/citation-record","integrity":"/paper/2503.19595/integrity","json":"/paper/2503.19595/citation-record.json","paper":"/paper/2503.19595"},"outbound":[],"paper":{"arxiv_id":"2503.19595","last_updated":"2025-08-17T21:21:08Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T02:48:45.856608Z","submitted_at":"2025-03-25T12:21:26Z","title":"Optimizing Language Models for Inference Time Objectives using Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2503.19595."}