{"as_of":"2026-08-09T21:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2fd29ebf879e2262a5887261bee8ee53517cdea2a64235d26ea6f4df9d8780f9","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T12:09:09.970266Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.29185/citation-record","integrity":"/paper/2607.29185/integrity","json":"/paper/2607.29185/citation-record.json","paper":"/paper/2607.29185"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-03T12:09:03.872221Z","title":"arXiv preprint arXiv:2204.05862 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:03.872221Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:01f4ede018a3267913f9a8a64e3fcbf5c5f31691dbe655e1c3c86fbc12ca52f1","observation_id":"0dc2264c-ba80-4fbc-a6a6-4e29844905e9","resolution":{"observed_at":"2026-08-03T12:09:03.872221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-03T12:09:03.997789Z","title":"arXiv preprint arXiv:1909.08593 , year=","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:03.997789Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:64b07aaa69c695459a91c742809c6bc12d01f7a35856fa23edbebe4a038c4141","observation_id":"41d2d2aa-425d-4996-86ab-e048a4a8edbe","resolution":{"observed_at":"2026-08-03T12:09:03.997789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:04.149160Z","title":"Fine-Grained Human Feedback Gives Better Rewards for Language Model Training , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:04.149160Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:da3c9b5871211df12f6cd0701ff6f36ec852db078f684869a0c94649984b205e","observation_id":"431449d6-8799-4519-83f6-9f9298c0e0a0","resolution":{"observed_at":"2026-08-03T12:09:04.149160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:04.218493Z","title":"Proceedings of the 40th International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:04.218493Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:e74d012357b7d41198fd2676a307d7992de39e1138cfd6889f9369ff0dda6579","observation_id":"98425e2c-411b-4603-ad37-b60a5b6deac3","resolution":{"observed_at":"2026-08-03T12:09:04.218493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:04.366566Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:04.366566Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:3b749e9133360b9629841195d7475dd8a5f6b316f75eaa964a8a6aa82ec6d47f","observation_id":"253f7795-9355-42b0-a36b-e9ecf7a3f2e7","resolution":{"observed_at":"2026-08-03T12:09:04.366566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:04.482182Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:04.482182Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:0e407fefa055e454af0b00f835f6b57fe112c93319f7617e280ab2b05c1816dc","observation_id":"999280f8-9d1a-41e4-b281-f26268dbd9c0","resolution":{"observed_at":"2026-08-03T12:09:04.482182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:04.597246Z","title":"J1: Incentivizing Thinking in","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:04.597246Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:06007c3dbe7e7d841e9da9b103dba310fd10f2514199d7385595e8d1c80808bd","observation_id":"5c0d7c3c-cbfa-4876-8a0a-40a36dd1f089","resolution":{"observed_at":"2026-08-03T12:09:04.597246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:04.676252Z","title":"Learning Structured Output Representation using Deep Conditional Generative Models , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:04.676252Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:d6de0bff619e57dca68e25c476627fa1e8fe039871b0bae21973078fef95d0d8","observation_id":"fc97e75a-547a-4643-a6e4-d3e1d554138b","resolution":{"observed_at":"2026-08-03T12:09:04.676252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:04.762707Z","title":"Training language models to follow instructions with human feedback , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:04.762707Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:4b6b9437563fc888db8b3f349ee50856f1d7e0a2e0433ce615cd1dc299977329","observation_id":"bbfaef32-3e3b-49d4-95dc-0a9b9cb743b8","resolution":{"observed_at":"2026-08-03T12:09:04.762707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:04.944216Z","title":"InfoRM: Mitigating Reward Hacking in RLHF via Information-Theoretic Reward Modeling , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:04.944216Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:ebd1dc07a9663cd96a0561884976f963bac8f1a6d167e19818e185dbf1a43121","observation_id":"bb2aeee2-e7ee-4f98-b88c-ac1539f2f3e4","resolution":{"observed_at":"2026-08-03T12:09:04.944216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:05.175902Z","title":"Improving Reward Models with Synthetic Critiques","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:05.175902Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:3ad86d5ec98e4279081cac5b317224a73726b16109b108d280796ee397fcaaf0","observation_id":"2c49e1ae-d586-40e7-958e-1338a92d86f5","resolution":{"observed_at":"2026-08-03T12:09:05.175902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:05.271074Z","title":"Self-Generated Critiques Boost Reward Modeling for Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:05.271074Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:b02f8c1a1b283d85ba05ce6208f4a8766e52325ba42b575bccb9268d314c8ee2","observation_id":"80d06d8e-4780-42aa-895d-3a4d513f0c70","resolution":{"observed_at":"2026-08-03T12:09:05.271074Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-03T12:09:05.397076Z","title":"arXiv preprint arXiv:2408.11791 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:05.397076Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:c3c91e677dedfe087a34821c1c568b927ed77a2992f05c3931d0eda73f4c06e1","observation_id":"485eac96-9550-4488-868a-acade5e44020","resolution":{"observed_at":"2026-08-03T12:09:05.397076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:05.493941Z","title":"Generative Judge for Evaluating Alignment , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:05.493941Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:f5be51cc3492e8b875aa0a5a2d4cac03b8e7cac270a2e4b0cba30e70728317f7","observation_id":"98922cab-3159-4e19-8590-cf66749076a7","resolution":{"observed_at":"2026-08-03T12:09:05.493941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:05.653095Z","title":"Deep Reinforcement Learning from Human Preferences , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:05.653095Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:49d351a41ee1cf44c6899abc94c0ce91d2a7f85ca865b76e66fb625c9bed15a1","observation_id":"4f9561c5-399d-492f-be3c-31982f207d63","resolution":{"observed_at":"2026-08-03T12:09:05.653095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:05.784919Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:05.784919Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:52a26c8d71e9205895d38d9caeba837822143e816581defd705b59aa0f941ae8","observation_id":"c9c45d56-12f8-4fa6-9f17-2e48de8854ed","resolution":{"observed_at":"2026-08-03T12:09:05.784919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:05.923413Z","title":"Terry , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:05.923413Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:acd0885c66a137ecd3aa26e2459bb56e701c6788dc69f76050442c556aef5a15","observation_id":"c87ef72f-a19a-4448-b63a-45012dbb70cc","resolution":{"observed_at":"2026-08-03T12:09:05.923413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:06.009105Z","title":"1959 , publisher=","venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:06.009105Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:659147815981f5f445a7f2b258c7671816a84fdff1ba97635028e7a12bf576b9","observation_id":"99d8a67f-44b0-43b2-941a-ae5ef0deb5b8","resolution":{"observed_at":"2026-08-03T12:09:06.009105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:06.107054Z","title":"Rationalizing Neural Predictions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:06.107054Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:d5bf25da78a7ee9f0fba721c41157ed77511163d8e3eb1c8abd3f9371d1ee332","observation_id":"b7c64419-c3b0-4a5b-a4b3-48c316a6f2af","resolution":{"observed_at":"2026-08-03T12:09:06.107054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/068431-1126","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"STaR: Bootstrapping Reasoning With Reasoning , url =","venue":null,"work_id":"33dd836a-91b7-4877-8213-afc2fa0421ae","year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:06.296072Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:d3ef6de1338ab64e5d2d0d8e0399f234e7ac73e1ca8b28f1144142a267122ab1","observation_id":"73f6cb0e-d506-4901-a314-8e71d4b2359c","resolution":{"observed_at":"2026-08-03T12:13:46.150492Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.52202/075280-3184","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Saurous, Rif , booktitle =","venue":null,"work_id":"f4c56c9d-696f-4bed-aafb-198d2af061aa","year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:06.404409Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:acf7cf79bd977ea707028eba4579f81a8dadb4cc29f5a8fe82d47ebe9e95981d","observation_id":"be55845e-65b9-49d6-be88-4b0e8f15c7b4","resolution":{"observed_at":"2026-08-03T12:13:45.934005Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:06.520255Z","title":"Beyond Verifiable Rewards: Scaling Reinforcement Learning in Language Models to Unverifiable Data , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:06.520255Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:42fe222197e280060edc5f06dac7a2eee14620587512513967f23fd817bf8825","observation_id":"58a2f00e-2cec-4848-a7b3-052e9fb2700e","resolution":{"observed_at":"2026-08-03T12:09:06.520255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:06.747386Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:06.747386Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:cb056e76def31feccbe6942dee5f6e6752438705d23e495b24dae974d5e200d2","observation_id":"8c4cbae2-b25b-4815-ac02-52a2e1872a01","resolution":{"observed_at":"2026-08-03T12:09:06.747386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:06.931488Z","title":"Policy Gradient Methods for Reinforcement Learning with Function Approximation , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:06.931488Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:69eaff1b60353a1bb537e140a68c77b1aed15074032a1d7ea80a3784d3cbc2b7","observation_id":"886a19f1-4caa-44b8-b525-559dbd02ae8e","resolution":{"observed_at":"2026-08-03T12:09:06.931488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:07.125029Z","title":"2024 , editor =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:07.125029Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:c46686752540ede5f9f3d0c4d1f4f3fdc1bfb74573eb6a16a3ae57a8e6af0036","observation_id":"a255d2be-95fb-4824-8bac-d838c86dd918","resolution":{"observed_at":"2026-08-03T12:09:07.125029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16891","last_updated":"2025-04-23T17:13:04Z","snapshot_observed_at":"2026-08-07T15:59:48.302908Z","submitted_at":"2025-04-23T17:13:04Z","title":"AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16891","snapshot_observed_at":"2026-08-03T12:09:07.287104Z","title":"arXiv preprint arXiv:2504.16891 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:07.287104Z"},"links":{"cited_paper":"/paper/2504.16891","citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:2ab9e242801162d3ba6ff8f217d1dc97ac50c09900acb7a9fdf750ebcc4bd9e3","observation_id":"7d56f8fe-1f77-469b-b8b3-0e315a405ce6","resolution":{"observed_at":"2026-08-03T12:09:07.287104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:07.449364Z","title":"The Thirty-ninth Annual Conference on Neural Information Processing Systems Datasets and Benchmarks Track , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:07.449364Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:925af1597ef72b052ddec11aca41b24a85dd1419ad81d646c5dc76e67677f61a","observation_id":"7c3a15a3-b696-4f7f-bf85-4372992b453a","resolution":{"observed_at":"2026-08-03T12:09:07.449364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:07.583260Z","title":"WildGuard: Open One-stop Moderation Tools for Safety Risks, Jailbreaks, and Refusals of LLMs , url =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:07.583260Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:a5c59ab39cb21b07a6e0fedde076b7505a48d17c1390d4291d22a91f014baa2b","observation_id":"174e1aaa-f415-415a-bc21-aaa61d76f3f3","resolution":{"observed_at":"2026-08-03T12:09:07.583260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:07.793737Z","title":"O ffset B ias: Leveraging Debiased Data for Tuning Evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:07.793737Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:a4b5e911dd79d4e94bc515eb4bc369c200c8489fd4c4fc7f8728c81bf1881a51","observation_id":"b64833c2-6236-48f6-aca4-01d4997b3798","resolution":{"observed_at":"2026-08-03T12:09:07.793737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:07.896547Z","title":"Forty-second International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:07.896547Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:57c7916812750a402b30772cc2ae87146d68bbab056bb2a540d1a916f4246e31","observation_id":"293f4311-98c8-4572-b693-47dc9ffd176a","resolution":{"observed_at":"2026-08-03T12:09:07.896547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:07.999068Z","title":"and Lee, Jason","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:07.999068Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:9c869a8fd24d8333d8fdd753ce08874a37f0a1c01dd29452a3a0fb290de7e45d","observation_id":"90969518-4203-4f4d-984b-a76806aaa611","resolution":{"observed_at":"2026-08-03T12:09:07.999068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:08.110251Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:08.110251Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:230e86614216e59a97690037966cf7f66f2565ae39e50fe7a0db452827cfabed","observation_id":"4302bb35-3fe1-4775-a68d-d3db24b1de73","resolution":{"observed_at":"2026-08-03T12:09:08.110251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:08.182976Z","title":"and Hajishirzi, Hannaneh","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:08.182976Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:5727ff28c295d50eaf601879caa03252026a1192a22fc0e8fa7571f76e840164","observation_id":"c18b9ce1-29b8-457f-af93-eddc64eb3203","resolution":{"observed_at":"2026-08-03T12:09:08.182976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:08.277734Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:08.277734Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:67c546ca3857e055de2131c9ae3c62a5e2fb261b1f5e5968ca24ec213ad45227","observation_id":"b667365d-1ffb-4911-b7b3-517dfc6962aa","resolution":{"observed_at":"2026-08-03T12:09:08.277734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:08.375921Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:08.375921Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:65f5217e20423d19b7667936869f9f4c37ccca27c37dd504fc0216f35a0d8679","observation_id":"fed329e1-8fd5-4f2f-ac92-9af408c9a6ff","resolution":{"observed_at":"2026-08-03T12:09:08.375921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:08.484852Z","title":"Gonzalez and Ion Stoica , booktitle=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:08.484852Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:f9001e0c728fc667f10041beb2c24fa63df5d7e9335a51e436f976e01f4e9ac4","observation_id":"79867b3e-eb47-433e-b966-e7bbc593a997","resolution":{"observed_at":"2026-08-03T12:09:08.484852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:08.643164Z","title":"JudgeBench: A Benchmark for Evaluating","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:08.643164Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:3f1b4565a7439a3fb8cbfc0bc08d85a50309ed22010ab4aa678d942f1152cd01","observation_id":"8b8fa87e-aa81-4eac-a9fe-eaf6ac4e9f53","resolution":{"observed_at":"2026-08-03T12:09:08.643164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:08.759591Z","title":"Proceedings of the Twentieth European Conference on Computer Systems , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:08.759591Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:cfebfd4129c0ed78ba5d78b53c30bdc8d9c3c70bf5ccc7086657b6af7c25f3c6","observation_id":"218e1456-c11e-4cdd-8322-a84a0339dcef","resolution":{"observed_at":"2026-08-03T12:09:08.759591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:08.853125Z","title":"Proceedings of the ACM SIGOPS 29th Symposium on Operating Systems Principles , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:08.853125Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:0f4c07933b9f3d6f62404a0f796239ec59f5673d88a99fd1e0efa22cb51c1b1a","observation_id":"fc2aeba1-47cd-4469-acff-8e1c2b21b2e4","resolution":{"observed_at":"2026-08-03T12:09:08.853125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-03T12:09:08.946082Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:08.946082Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:f2de32437a25f0b437175df5cde1cb6da2bbb78c6bd4e3dce40344b135e33824","observation_id":"0076fc1e-1ad7-4427-aa0b-1a04f24cd55c","resolution":{"observed_at":"2026-08-03T12:09:08.946082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-03T12:09:09.065374Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:09.065374Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:790364256e4ca6d64bcef2b426aada3187078486f2060ab3de255c73b32067ac","observation_id":"87186d91-407e-45f9-9956-6060da303d7c","resolution":{"observed_at":"2026-08-03T12:09:09.065374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:09.185899Z","title":"Second Conference on Language Modeling , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:09.185899Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:3b90e8b5e739dabb7d35c6dd004b218cb23fac857cefe8f0b69dd06be31b060b","observation_id":"fa4bf8ca-2535-4ee2-8908-0f9ab5e3a769","resolution":{"observed_at":"2026-08-03T12:09:09.185899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:09.348666Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:09.348666Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:1c1d6f63a45cf32df93d7f4d00063bfac0a07dd2c19f9c298b1582d6858f802d","observation_id":"1c6d41ef-8c97-46da-925a-a457b1746d47","resolution":{"observed_at":"2026-08-03T12:09:09.348666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:09.492302Z","title":"First Conference on Language Modeling , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:09.492302Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:53e4a7aa33b4c9809a3e920fcc74f97b7c803329f3c96cfe8769a241dfb531a2","observation_id":"78c659ae-7380-4c7b-bb48-9f6a876a6875","resolution":{"observed_at":"2026-08-03T12:09:09.492302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:09.677129Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:09.677129Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:9a1e7299d318b12b4e2c858131b58354d8ab294ac42d10fcb78eaf7c09cce86d","observation_id":"8ccac31c-3c99-483c-a628-34cdebbdedb8","resolution":{"observed_at":"2026-08-03T12:09:09.677129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:09.790291Z","title":"and Sreedhar, Makesh Narsimhan and Kuchaiev, Oleksii , booktitle =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:09.790291Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:4b4f290416465290543771cd57016ebc8be59f1557a421499ee9696aa1ff28e9","observation_id":"cef30655-655a-4144-9f6b-2b1535ee6cc5","resolution":{"observed_at":"2026-08-03T12:09:09.790291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T12:09:09.970266Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:09.970266Z"},"links":{"citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:d605151432e34ffbc3496cdf5c505f6c8702880bf986ce6ea942e99c51268106","observation_id":"f2de6b5f-bd72-4163-810d-d55b1e16c122","resolution":{"observed_at":"2026-08-03T12:09:09.970266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2607.29185."}