{"as_of":"2026-08-14T18:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4034ac6cb7a06b34236c7a793ecea8914679e4fef360a66fa95f1dd4f24df53b","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T01:52:02.517746Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.25659/citation-record","integrity":"/paper/2607.25659/integrity","json":"/paper/2607.25659/citation-record.json","paper":"/paper/2607.25659"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.281764Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.281764Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:795a33f6212afec9e41d8ec5fb0754e6eba3bc180c27285eb380ea9c827003fb","observation_id":"d4e5bf94-41ca-4fb9-ac42-97162986f8ed","resolution":{"observed_at":"2026-08-01T01:52:02.281764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.287843Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.287843Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:bee25ffa688ed671e5c266cb65b39a5e52e26c4f0621acddec94b74ce805b842","observation_id":"bea19546-555e-4372-899e-faad9d654d27","resolution":{"observed_at":"2026-08-01T01:52:02.287843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.292292Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.292292Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:b75407ea1ccc582492c936d61b7a0f0d6f5c5b6a449e190cd1b78f8d902f2960","observation_id":"031f23cc-6ff5-4363-88f5-4a3d83f983e0","resolution":{"observed_at":"2026-08-01T01:52:02.292292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.296787Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.296787Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:1c2ee965896bdbcf227afcba79760d5085458c0b2911148ace3db42b4483926a","observation_id":"cf5f8084-4cd4-4beb-9bb4-a4af4091f56a","resolution":{"observed_at":"2026-08-01T01:52:02.296787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.301364Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.301364Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:f2459c324c290061ee46b1b32325260abb907f595f9e2b95921ba1aa49fd6066","observation_id":"029dbbdc-9bc9-4769-91fe-1a7632f31b9e","resolution":{"observed_at":"2026-08-01T01:52:02.301364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.305972Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.305972Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:723f4def127c670af5acb9dfca4d00fd48367b585f073e409cd90d6d4a83991b","observation_id":"14cc2846-ea2e-46d3-9b93-9cfa3adf2951","resolution":{"observed_at":"2026-08-01T01:52:02.305972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.310961Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.310961Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:3d40495f771231f36c2c863f5f6ab27cbbca62c6207c2240c82e18d55163ca34","observation_id":"37c13eec-aa26-4575-87fb-3084278f5d59","resolution":{"observed_at":"2026-08-01T01:52:02.310961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.315552Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.315552Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:06db544f7b8e0efb0e413b99540769d37c121708360eb525fd7373d1de72d5f0","observation_id":"406497d2-7e78-4100-b276-e90df5358498","resolution":{"observed_at":"2026-08-01T01:52:02.315552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.319800Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.319800Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:5199eab92428c0c1e66441d48b838ea21567d4272172f7dc84d8e0bc6ce4094e","observation_id":"aceaeceb-60e9-490c-b384-bcbd9465245a","resolution":{"observed_at":"2026-08-01T01:52:02.319800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.324700Z","title":"NeurIPS 2025 Workshop on Efficient Reasoning , year=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.324700Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:90cda6f063ebca758d5a6d2d4f83e1b564dba1ecc40d2825fde5f8112d150f4a","observation_id":"34dae7ad-51d8-4702-aaec-601b67a86ddf","resolution":{"observed_at":"2026-08-01T01:52:02.324700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.329319Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.329319Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:bcc01ab3f4899631ae8f277e7d78bb79941e6ed598b844b7de8a0379cbd8e499","observation_id":"63151e3e-2ef8-4355-b3a7-d6476766c662","resolution":{"observed_at":"2026-08-01T01:52:02.329319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.333486Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.333486Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:88fef3a3607f0d635286fff96f3cc3dc1d8bbd97c5972cd849e8c9b45a416488","observation_id":"9c41472d-e77c-4984-9a62-0c9dc467881a","resolution":{"observed_at":"2026-08-01T01:52:02.333486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.337688Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.337688Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:136d8dfa30e53a83cdabc38e68ac36311779416838c474fdadab90fcd48661a6","observation_id":"0f59b9b5-f567-4b8a-9de0-ec738d5f571e","resolution":{"observed_at":"2026-08-01T01:52:02.337688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.341921Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.341921Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:d0cf08f4e25c01ed5419215efb1277f539c768d74ebc3d0a86da74ab48f2e905","observation_id":"156cd443-06da-4e8b-9036-9fdb0d85d21f","resolution":{"observed_at":"2026-08-01T01:52:02.341921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.346262Z","title":"Proceedings of the 12th Annual Conference on Computer Graphics and Interactive Techniques , pages =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.346262Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:a2bc92be152f0eca18874d55cfca22486039fc8a1faba1a6d90a8ca9d69fea98","observation_id":"1e4c47de-57bd-4b61-95e2-ec02196a1e89","resolution":{"observed_at":"2026-08-01T01:52:02.346262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.350560Z","title":"Machine Learning , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.350560Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:8785141d3c5f0c9a231af84bbc130ec5070cd2605ef483cdbb4c8895df15ef38","observation_id":"23d706cb-a763-44b6-9d35-af692cb66590","resolution":{"observed_at":"2026-08-01T01:52:02.350560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.355009Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.355009Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:35f9d020cb26bab005ae3652b89643439d0b8677a10678eb59ececcc298d6f5e","observation_id":"d368c68d-316b-41d8-b882-bed880420339","resolution":{"observed_at":"2026-08-01T01:52:02.355009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.359613Z","title":"Findings of the Association for Computational Linguistics: ACL 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.359613Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:4a7fe90bfaf0e48ba6951149e88f3a84eb60a1749f5f263fb047eb4591d8ce5c","observation_id":"190e7da1-0325-4fa0-b071-885335bda75a","resolution":{"observed_at":"2026-08-01T01:52:02.359613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.364021Z","title":"Proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.364021Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:4e74406da61103dcc5df2f211e71e2d655cc306118e871d566ebaad4e68772c0","observation_id":"6f3ea0cf-2511-4549-8d46-98bbe0eec267","resolution":{"observed_at":"2026-08-01T01:52:02.364021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.368769Z","title":"From Generation to Judgment: Opportunities and Challenges of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.368769Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:f815c8fedd59d8dfb10d5d8ab1da8cd0baf7cdeee27bd12244a42a7c0adf467b","observation_id":"a2065375-3491-475d-9581-1a15bbd250c4","resolution":{"observed_at":"2026-08-01T01:52:02.368769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.373417Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.373417Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:c4e01f1f9f6148ca91838cdb2025f08ffeea4be9e0649721c76a91e43c76011f","observation_id":"b870122e-ed2f-431a-ad5d-a06161f4a113","resolution":{"observed_at":"2026-08-01T01:52:02.373417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.378348Z","title":"Computational Linguistics , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.378348Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:9d6d6b0370124abe7431b33408ee3ff3059b3d375effa92f54e3c38ef59d1e2b","observation_id":"7fcc690d-0329-4642-a660-b6d0647ddd8b","resolution":{"observed_at":"2026-08-01T01:52:02.378348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-01T01:52:02.382901Z","title":"arXiv preprint arXiv:2212.08073 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.382901Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:2bd992306fe6e5fe0168cfb1bbb110419190ddbb15bfc16b7394fa7bffe509c5","observation_id":"ec8f0b2b-8204-4f70-9228-e9241234c450","resolution":{"observed_at":"2026-08-01T01:52:02.382901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02823","last_updated":"2024-04-03T15:55:39Z","snapshot_observed_at":"2026-08-13T00:38:21.431127Z","submitted_at":"2024-04-03T15:55:39Z","title":"Conifer: Improving Complex Constrained Instruction-Following Ability of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02823","snapshot_observed_at":"2026-08-01T01:52:02.388245Z","title":"arXiv preprint arXiv:2404.02823 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.388245Z"},"links":{"cited_paper":"/paper/2404.02823","citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:56a7e880fb633e90d875b01d014a95578dec4b04b136518174443bb8dc0bf0bf","observation_id":"8f63742b-9734-4084-9bc8-1ea3a7a3d81c","resolution":{"observed_at":"2026-08-01T01:52:02.388245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.21726","last_updated":"2026-05-20T20:36:26Z","snapshot_observed_at":"2026-08-07T09:42:32.356659Z","submitted_at":"2026-05-20T20:36:26Z","title":"Probabilistic Attribution For Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.21726","snapshot_observed_at":"2026-08-01T01:52:02.393126Z","title":"arXiv preprint arXiv:2605.21726 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.393126Z"},"links":{"cited_paper":"/paper/2605.21726","citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:b21cffacdd197eac5bc1fca1800bc2583bc6b939e9fb7fae5e03f4f4f3b14408","observation_id":"35c04bb7-a48e-4f65-b89a-eb4165b2b3d0","resolution":{"observed_at":"2026-08-01T01:52:02.393126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.398455Z","title":"arXiv preprint arXiv:2512.23457 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.398455Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:4d98eb3c3dc0155c5ce0448f995dbf975b5c8a9ad55a0fd166af2ae8300bcbc1","observation_id":"89b284e0-dce9-4b4a-ac38-72c9538955f3","resolution":{"observed_at":"2026-08-01T01:52:02.398455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.403060Z","title":"arXiv preprint arXiv:2511.10507 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.403060Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:17068dc14cc34a26e4ee76df5d240c434076c77c98c25d41a2eef4aa4cb62580","observation_id":"c2b0cc37-69f0-4e28-9e7c-54d4f13ed042","resolution":{"observed_at":"2026-08-01T01:52:02.403060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.407471Z","title":"arXiv preprint arXiv:2509.19199 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.407471Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:a961b3191ed9c76cb59b6e02132b81121360cf27614cecd2564ba27456dec8af","observation_id":"0df0d396-1817-46a0-bea1-0533f77635f5","resolution":{"observed_at":"2026-08-01T01:52:02.407471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.16165","last_updated":"2026-05-29T05:19:17Z","snapshot_observed_at":"2026-08-14T12:35:59.119505Z","submitted_at":"2026-02-18T03:31:34Z","title":"HiPER: Hierarchical Reinforcement Learning with Explicit Credit Assignment for Large Language Model Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.16165","snapshot_observed_at":"2026-08-01T01:52:02.411714Z","title":"arXiv preprint arXiv:2602.16165 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.411714Z"},"links":{"cited_paper":"/paper/2602.16165","citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:9b7111e2104479460ba7a8716f7537f025b3bd0d336127e70773fcecad991e59","observation_id":"4f318d49-7162-4062-9395-5e70f20c5c66","resolution":{"observed_at":"2026-08-01T01:52:02.411714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.416701Z","title":"arXiv preprint arXiv:2603.08754 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.416701Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:5ce6296d9ad15c94f28c199fbea6e5f211154ef1183ce41b8737f99a3dbdbc22","observation_id":"e72dedb9-1533-41b7-a921-bf81ed9c770e","resolution":{"observed_at":"2026-08-01T01:52:02.416701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.421730Z","title":"arXiv preprint arXiv:2601.08430 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.421730Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:7f3efdff898c28f5edd68318197fff71a11fb664a66a792be1e7385b049cdcd6","observation_id":"647ab12c-787a-448b-a255-14fc95088eab","resolution":{"observed_at":"2026-08-01T01:52:02.421730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-08-14T11:40:15.905224Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.02795","snapshot_observed_at":"2026-08-01T01:52:02.426284Z","title":"arXiv preprint arXiv:2604.02795 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.426284Z"},"links":{"cited_paper":"/paper/2604.02795","citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:6a934f8d4259969733025ef30f6ad7bef30a22c8769fe8ce6bd41518c1ae5e93","observation_id":"11a5e376-83be-4e00-9059-fc6f8fb46862","resolution":{"observed_at":"2026-08-01T01:52:02.426284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.430980Z","title":"arXiv preprint arXiv:2508.16949 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.430980Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:899f2f8129222649e0291dee54599c04b557cc3652b73c2c2eef3ddd360fb087","observation_id":"104e30d9-1c2e-4632-abe1-f7ec2a78079c","resolution":{"observed_at":"2026-08-01T01:52:02.430980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03128","last_updated":"2026-04-08T08:22:36Z","snapshot_observed_at":"2026-08-03T04:49:13.270533Z","submitted_at":"2026-04-03T15:50:07Z","title":"Self-Distilled RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03128","snapshot_observed_at":"2026-08-01T01:52:02.435481Z","title":"arXiv preprint arXiv:2604.03128 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.435481Z"},"links":{"cited_paper":"/paper/2604.03128","citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:6718f000ad9c7e542ad0a023b607148b09e799c810971285811a48772e804654","observation_id":"7d82b2ed-2b5b-4b33-8bfc-2f0cbbea53c8","resolution":{"observed_at":"2026-08-01T01:52:02.435481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.440062Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.440062Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:f2c25df56877a11c7b10c07cea36303ccbe90e2962a739486e1e0f3a3edf0a4c","observation_id":"7f85128b-f8cb-4594-8b9c-a692bf7224ca","resolution":{"observed_at":"2026-08-01T01:52:02.440062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T01:52:02.444230Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.444230Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:20a36b22765c0eef9bd669bbd4c7e134fac930e94f3df5d0276552259c55ba95","observation_id":"6523b596-bfc5-436d-8191-23449ca69c77","resolution":{"observed_at":"2026-08-01T01:52:02.444230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-01T01:52:02.448730Z","title":"arXiv preprint arXiv:2311.07911 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.448730Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:8b260fe91adce004f1e2f5cfefe090fcdb81903df58c27bd01924c1baca9ea34","observation_id":"61fdaf94-133b-48ec-91c5-1134e1a81d18","resolution":{"observed_at":"2026-08-01T01:52:02.448730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07591","last_updated":"2026-04-15T04:31:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T14:16:55Z","title":"MulDimIF: A Multi-Dimensional Constraint Framework for Evaluating and Improving Instruction Following in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07591","snapshot_observed_at":"2026-08-01T01:52:02.453431Z","title":"arXiv preprint arXiv:2505.07591 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.453431Z"},"links":{"cited_paper":"/paper/2505.07591","citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:7757ebca72a794b58cd468a86d498c3f1366c8906a253e50b47c533710c5f86b","observation_id":"8f26d11b-1a5c-4d90-842e-fa713e36e00b","resolution":{"observed_at":"2026-08-01T01:52:02.453431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-08-12T16:05:52.077251Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-01T01:52:02.458662Z","title":"arXiv preprint arXiv:2507.18071 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.458662Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:7d83a6f1f974d0f9fe98edad9bf2a140a27f35d7f4e548750742c5c981bfde96","observation_id":"2ed24d3b-e25f-4c7f-860c-7829083f532e","resolution":{"observed_at":"2026-08-01T01:52:02.458662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-01T01:52:02.463478Z","title":"arXiv preprint arXiv:2407.21783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.463478Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:b7e22d637b97ca39e689809883b456af42ef026e682e0e2f2b3ff7191444bd8e","observation_id":"395710e0-aa83-40c0-ab23-0e61267842fc","resolution":{"observed_at":"2026-08-01T01:52:02.463478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T01:52:02.467945Z","title":"arXiv preprint arXiv:2505.09388 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.467945Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:ed443122a26159cef500144be3c4501bea7286e68a7fb7071f625da854a6f571","observation_id":"40ba7d64-5a45-4870-97dc-af7f0c83f7ad","resolution":{"observed_at":"2026-08-01T01:52:02.467945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-01T01:52:02.472574Z","title":"arXiv preprint arXiv:2412.15115 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.472574Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:36cbd9eec6400c1ffbb7cef9aa55dd01380bdf2bbb78304a4b191a33e71b59c3","observation_id":"1c5bfd7a-f17f-48ca-88a5-d674ff3233ad","resolution":{"observed_at":"2026-08-01T01:52:02.472574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-01T01:52:02.477551Z","title":"arXiv preprint arXiv:2601.05242 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.477551Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:45ae37bb099b018e71cb56c6b2e2c90ec968b2bcfb964733a63e7f309d2205e2","observation_id":"4b357547-316a-48f5-a73c-4ec5b56ddc10","resolution":{"observed_at":"2026-08-01T01:52:02.477551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T01:52:02.482243Z","title":"arXiv preprint arXiv:1707.06347 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.482243Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:01c7b1f4bedddd7d00526155a98fb4a18b2b62b7f7a0dd9bf1dd5c67074fb3b1","observation_id":"2dc21fb3-ccbe-4119-b851-cc5e0a8819cf","resolution":{"observed_at":"2026-08-01T01:52:02.482243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00399","last_updated":"2018-03-21T11:43:46Z","snapshot_observed_at":"2026-07-06T06:07:14.578359Z","submitted_at":"2017-11-01T15:39:23Z","title":"Counterfactual Explanations without Opening the Black Box: Automated Decisions and the GDPR","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.00399","snapshot_observed_at":"2026-08-01T01:52:02.486709Z","title":"arXiv preprint arXiv:1711.00399 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.486709Z"},"links":{"cited_paper":"/paper/1711.00399","citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:74c25ea82065a0b670b44d468ddfa5cd7068588df223eba90e473038ae1a02f0","observation_id":"dfeeab2b-5a52-4fe3-847c-679898dae623","resolution":{"observed_at":"2026-08-01T01:52:02.486709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.491356Z","title":"arXiv preprint arXiv:2510.00194 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.491356Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:59e8c07062b78243bcc87261e95ffd684fe42e4bbc5a2d3bef0af05a07a1b42b","observation_id":"0b8610db-4088-4402-8f66-f47e301b87b4","resolution":{"observed_at":"2026-08-01T01:52:02.491356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-01T01:52:02.496398Z","title":"arXiv preprint arXiv:2412.16720 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.496398Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:00ce9e4c90128f3d9498efc7177af5612ee73f4560182025fd8c02ec404682b4","observation_id":"9d0c09e4-a157-4e5d-8442-b0d670056806","resolution":{"observed_at":"2026-08-01T01:52:02.496398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.501775Z","title":"Nature , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.501775Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:5b71ec40480e0a5626b585dd66bc803ca670ed5f746dd31e848cf06426f11921","observation_id":"1c1d62ca-9229-4710-aed5-547a1c4786c4","resolution":{"observed_at":"2026-08-01T01:52:02.501775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.506654Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.506654Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:d7391bafcaed99a302d3595bea880647af2c6b8f7bf8e6639f8cb16fe1db60a6","observation_id":"8027817f-d979-4dfd-9b7e-7779049f0268","resolution":{"observed_at":"2026-08-01T01:52:02.506654Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.512266Z","title":"Proceedings of the Thirty-Eighth","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.512266Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:1aa13a424fad576c949675222cb9fe31bf142fa84bd4b21ca1120ffe7c41378c","observation_id":"cb902165-c989-4696-a123-a16c86dcfbe4","resolution":{"observed_at":"2026-08-01T01:52:02.512266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T01:52:02.517746Z","title":"Proceedings of the Thirty-Eighth","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.517746Z"},"links":{"citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:dcce3330aeac84e7b417cafedf3b71a99a450f7cb0c0d264902f011910e13779","observation_id":"292ad71d-5ead-4706-aeb1-4d505edcaef5","resolution":{"observed_at":"2026-08-01T01:52:02.517746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-14T11:40:59.967980Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":50,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2607.25659."}