{"as_of":"2026-08-05T19:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:68f721963eaf800ee683777b68eca02fa25fec37c5fb70d387e06d60e3b3d1b0","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T20:24:17.788697Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:13:30.379059Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.02795","snapshot_observed_at":"2026-08-01T16:14:24.867079Z","title":"Rubrics to tokens: Bridging response-level rubrics and token-level rewards in instruction following tasks.CoRR, abs/2604.02795,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18082","last_updated":"2026-08-03T04:07:59Z","snapshot_observed_at":"2026-08-05T19:49:54.037774Z","submitted_at":"2026-07-20T15:50:02Z","title":"CriPO: Enhancing Rubric-based RL via Self-Distillation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T16:14:24.867079Z"},"links":{"cited_paper":"/paper/2604.02795","citing_paper":"/paper/2607.18082"},"observation_digest":"sha256:2cf63939a3a7c28c3fce9e212fb584cadaf3935d445bb10e079bd33103becb1d","observation_id":"dd1e3b49-0c0c-49b5-bab9-e2045fd52358","resolution":{"observed_at":"2026-08-01T16:14:24.867079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.02795","snapshot_observed_at":"2026-08-04T04:13:30.379059Z","title":"Rubrics to tokens: Bridging response-level rubrics and token-level rewards in instruction following tasks.CoRR, abs/2604.02795,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18082","last_updated":"2026-08-03T04:07:59Z","snapshot_observed_at":"2026-08-05T19:49:54.037774Z","submitted_at":"2026-07-20T15:50:02Z","title":"CriPO: Enhancing Rubric-based RL via Self-Distillation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T04:13:30.379059Z"},"links":{"cited_paper":"/paper/2604.02795","citing_paper":"/paper/2607.18082"},"observation_digest":"sha256:a6abb9f9db571a37495f74cec5d4a836cdf96a72d3c22f38e0bc1d94580c00cb","observation_id":"66f4fb2a-9577-44f2-a66c-69b751a9f6bd","resolution":{"observed_at":"2026-08-04T04:13:30.379059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.02795","snapshot_observed_at":"2026-08-01T01:52:02.426284Z","title":"arXiv preprint arXiv:2604.02795 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25659","last_updated":"2026-07-28T12:45:19Z","snapshot_observed_at":"2026-08-01T01:52:01.249218Z","submitted_at":"2026-07-28T12:45:19Z","title":"CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T01:52:02.426284Z"},"links":{"cited_paper":"/paper/2604.02795","citing_paper":"/paper/2607.25659"},"observation_digest":"sha256:11979c5b24d064c4b684cd12b42fa835aa4949cb5000cd96b7a8f5ad63afde20","observation_id":"11a5e376-83be-4e00-9059-fc6f8fb46862","resolution":{"observed_at":"2026-08-01T01:52:02.426284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2604.02795/citation-record","integrity":"/paper/2604.02795/integrity","json":"/paper/2604.02795/citation-record.json","paper":"/paper/2604.02795"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d2df04f4-fc54-4e3f-885d-99c96bf2df6b","year":2025},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:69583773b6d7bae3a7854b0a2af7c834cac905b2efc4839b4624df32c418c68d","observation_id":"b521c8ba-dcb7-4408-a6fa-0941b63ed237","resolution":{"observed_at":"2026-05-14T01:43:39.561741Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02436","last_updated":"2024-03-15T03:11:44Z","snapshot_observed_at":"2026-08-05T18:35:49.231138Z","submitted_at":"2023-12-05T02:32:08Z","title":"MUFFIN: Curating Multi-Faceted Instructions for Improving Instruction-Following","version":3},"cited_work":{"arxiv_id":"2312.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02436","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"51277664-7736-4071-8373-314ae54ebf85","year":2023},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"cited_paper":"/paper/2312.02436","citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:109a7aa0bb74302a1f90858238e552c25bc1156f475ef90602e2a7a16f1b76bc","observation_id":"efd6b045-e849-4d57-a10e-7817195a8905","resolution":{"observed_at":"2026-05-13T20:28:14.065384Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f04d0f64-6537-4378-9c77-9cfab5953e2a","year":2022},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:217f91a16d9e01c53b97200078697add5276dfe923bf9cc5ee993efb88215543","observation_id":"116c81e7-532d-4382-8db7-14e1feb3cde7","resolution":{"observed_at":"2026-05-14T01:43:39.501091Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e4d58403-c0b5-4892-8e35-ec54d3f69d60","year":2025},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:af9cb7d66d2055fb020d55c3e20911d4e6bd0022451c0b15902ce89efcff728a","observation_id":"da8cb71f-bc64-48b8-b797-6162fbe235f7","resolution":{"observed_at":"2026-05-14T01:43:39.441069Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.05758","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T13:28:18.200195Z","title":"arXiv preprint arXiv:2602.05758 , year =","venue":null,"work_id":"db8cb46f-8a13-4ca0-9e77-05cfb9cf46ce","year":2026},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:93169ed3b1e4f033b76f8d97ff1889a2b9bf10ae88f2f2f249900e65f711d898","observation_id":"3dc2d42a-729f-4ca8-a238-33c3927117f0","resolution":{"observed_at":"2026-05-13T20:28:14.075391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02833","last_updated":"2025-11-11T09:40:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-03T17:44:33Z","title":"Generalizing Verifiable Instruction Following","version":3},"cited_work":{"arxiv_id":"2507.02833","doi":"10.48550/arxiv.2507.02833","metadata_source":"pith","pith_arxiv_id":"2507.02833","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generalizing Verifiable Instruction Following","venue":"cs.CL","work_id":"f761e9b8-8bc1-4bf7-bdab-175a13950f4e","year":2025},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"cited_paper":"/paper/2507.02833","citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:af53be15f44df25f21a4564db5c1027cf2a324e908dd16802c7bf4ecac2fac24","observation_id":"25bdb2c8-00b7-4b93-8ba0-400368f22a98","resolution":{"observed_at":"2026-05-13T20:28:14.070453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4f72dba1-61e8-4a06-b919-7a5e159800e6","year":2024},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:eb125301229af36388a5afd294c851e30b7c264b9181ff439808da4d8a6a6e3c","observation_id":"543ccea0-9775-42e9-8521-5b3d8daa4844","resolution":{"observed_at":"2026-05-14T01:43:39.456192Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"33e2a7b5-ec1e-4a3a-9d96-15631b2c91d8","year":2025},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:293c135bfc7b31b7a3ad0613df2db5f97c71824d37f435e12adad63425a6e299","observation_id":"5da9ed92-d5b5-4756-a55e-af3489137d50","resolution":{"observed_at":"2026-05-14T01:43:39.472313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"324dae3b-b61b-4e6b-88b5-a2f4ff3d6ad2","year":null},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:6e0e1e069a7ea1884775f3b287d556b563a64b32150a021427fcaf07a4e47f83","observation_id":"33b83f5b-2a6f-4022-a28c-4c1158cb413f","resolution":{"observed_at":"2026-05-14T01:43:39.433284Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"401a55b2-2c59-44d6-9a4b-3b074cde643e","year":null},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:78e68af8bbcf450dc53e3719b8bea7c4c16692d26c94a174f6b1caf3bd8aff85","observation_id":"9c288509-656d-4486-b6c7-667119ca0ed2","resolution":{"observed_at":"2026-05-14T01:43:39.459519Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":"2311.12022","doi":"10.48550/arxiv.2311.12022","metadata_source":"pith","pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":"cs.AI","work_id":"9e2a976b-f5ad-4aee-af5c-243fe0fe75d2","year":2023},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:5c40648135c10e56e768073d003822323ebfbb91a3e6fa9e512ff28b6b1944b5","observation_id":"5902e562-1a80-46a3-8933-7a6ca6ff587b","resolution":{"observed_at":"2026-05-13T20:28:14.067924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":"2402.03300","doi":"10.1016/0004-3702(73)90011-8","metadata_source":"pith","pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","venue":"cs.CL","work_id":"c5006563-f3ec-438a-9e35-b7b484f34828","year":2024},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:07677821e6784f76a3ff2a8fcea2f7ad3d478d9140fb93836e10cdcc3ba1b957","observation_id":"d17dd4bd-3191-4b99-aa10-737033bff8dc","resolution":{"observed_at":"2026-05-13T20:28:14.072869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.07685","doi":"10.48550/arxiv.2511.07685","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ResearchRubrics : A benchmark of prompts and rubrics for evaluating deep research agents","venue":"ArXiv.org","work_id":"4b4b3d79-0d0f-4c57-9d4e-37ea9fad28af","year":2025},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:e5842510d44de6bcdc7dd0667ea34c62995ab537b92afb17a712d0cf89a25458","observation_id":"8739e55a-103a-4e6f-95f4-f066dee9189e","resolution":{"observed_at":"2026-05-13T20:28:14.095980Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09726","last_updated":"2025-08-13T11:43:49Z","snapshot_observed_at":"2026-07-06T22:12:21.217145Z","submitted_at":"2025-08-13T11:43:49Z","title":"Sample More to Think Less: Group Filtered Policy Optimization for Concise Reasoning","version":1},"cited_work":{"arxiv_id":"2508.09726","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.09726","snapshot_observed_at":"2026-07-04T07:59:40.674459Z","title":"Sample more to think less: Group filtered policy optimization for concise reasoning.arXiv preprint arXiv:2508.09726","venue":null,"work_id":"f2a309b4-ac64-4cae-a98d-af7f6b84fce8","year":2025},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"cited_paper":"/paper/2508.09726","citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:ba395664719a05b68d7b277beb5dc1527d021e5bddf88b4f0696173b81f8a11d","observation_id":"6f2b12b8-3864-47d4-a1f7-9d783f69f61f","resolution":{"observed_at":"2026-05-13T20:28:14.101220Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.04136","last_updated":"2026-07-04T19:39:07Z","snapshot_observed_at":"2026-08-03T09:01:09.893540Z","submitted_at":"2025-07-05T19:13:00Z","title":"A Technical Survey of Reinforcement Learning Techniques for Large Language Models","version":2},"cited_work":{"arxiv_id":"2507.04136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04136","snapshot_observed_at":"2026-07-07T02:18:25.553364Z","title":"A technical survey of reinforcement learning techniques for large language models","venue":null,"work_id":"b5d76691-645d-4749-8916-53eb4e8764f4","year":2025},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"cited_paper":"/paper/2507.04136","citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:0c6e4c97e56e2ed02be23dca876c77398c906bec9e8507fe1004f8e4a7b55aaf","observation_id":"9b45a3ec-b166-4200-b16c-1ddfe4b32318","resolution":{"observed_at":"2026-07-07T02:18:25.553364Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.04349","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:27:07.358056Z","title":"Gtpo and grpo-s: Token and sequence-level reward shaping with policy entropy.arXiv preprint arXiv:2508.04349","venue":null,"work_id":"c337a3f9-8f7e-4f6a-b463-5f4193cee20b","year":2025},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:d73614f7891fd156636f8d860bbba575b4f4a733e477ac9484c7545a93214842","observation_id":"ba47e0c6-3827-43df-bec8-d4b2f512ed1e","resolution":{"observed_at":"2026-05-13T20:28:14.093418Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5070adb3-9ed7-4f0e-abd4-508856f42267","year":null},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:0fb40918738f07433e1f2249be628c0ca47d34117718ce11cad5e9c1ad7fcba4","observation_id":"5fbb7ee8-8053-4a12-89bb-c521314d04ef","resolution":{"observed_at":"2026-05-14T01:43:39.548048Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06122","last_updated":"2025-06-06T14:33:56Z","snapshot_observed_at":"2026-07-06T21:37:56.477028Z","submitted_at":"2025-06-06T14:33:56Z","title":"Reinforcement Learning Optimization for Large-Scale Learning: An Efficient and User-Friendly Scaling Library","version":1},"cited_work":{"arxiv_id":"2506.06122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06122","snapshot_observed_at":"2026-07-04T10:29:45.796847Z","title":"Reinforcement learning optimization for large-scale learning: An efficient and user-friendly scaling library.arXiv preprint arXiv:2506.06122, 2025a","venue":null,"work_id":"37914127-0152-4730-8654-8b15734bd5f9","year":2025},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"cited_paper":"/paper/2506.06122","citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:5428d8885b0672db74686481961d4750016fda9950ec539ce7c39ceb313977d1","observation_id":"1d08131e-bc68-4cac-8b13-e6311204bd50","resolution":{"observed_at":"2026-05-13T20:28:14.103827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0bb7c334-dda1-4def-b297-b7e64fde113c","year":2026},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:c1d1533c878e7b557961c58adeecceabd219aa8e4930d638170632b89236d177","observation_id":"bc0bd9bd-0311-4a83-a1e2-89d4130b0225","resolution":{"observed_at":"2026-05-14T01:43:39.575694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":"2406.01574","doi":"10.1145/3711896.3737413","metadata_source":"pith","pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","venue":"cs.CL","work_id":"3c028052-035a-4c22-b80e-3046edb44adc","year":2024},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:263ae390ec5ca8b15604d75294a7358d0ca41c5708239f278aa5dcdf36caa5c9","observation_id":"6a2f23db-da70-419b-984e-dde9af5f0f48","resolution":{"observed_at":"2026-05-13T20:28:14.085645Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ef29c04c-77da-4468-9b0d-4d11d14e63ff","year":2024},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:977e86c48264703c1141615a0fc8c2ce3e18bc6de5bd0a27d08a9ab1d5396559","observation_id":"b2e196ac-4874-4a8d-9041-65d2ceb53328","resolution":{"observed_at":"2026-05-14T01:43:39.528007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a833fcbd-1b12-4721-84ad-165da70fba01","year":2018},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:3d926371eca3e4ab6eb907730b9665da2bb61df410d5a00a7f142ed567110eb4","observation_id":"1e448540-d245-43f0-9ef4-c6c6c14efcf5","resolution":{"observed_at":"2026-05-14T01:43:39.555272Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":"2304.12244","doi":"10.48550/arxiv.2304.12244","metadata_source":"pith","pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","venue":"cs.CL","work_id":"fc22911b-0900-4ad2-b106-337f13279965","year":2023},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:7c34f477ca509333c61c384ed4fe0d2d8958d2e71d0db82f24021c73e94713a0","observation_id":"1dcecb14-4fe3-4540-82ce-12f68fd7f60c","resolution":{"observed_at":"2026-05-13T20:28:14.088088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:2311e5db3d407626b5ce0d7ed689795e35c9ca1ac75c8253f57213b1dd3b4406","observation_id":"af59cd9a-ce83-41ac-b56d-6e79232d26c3","resolution":{"observed_at":"2026-05-13T20:28:14.090783Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07591","last_updated":"2026-04-15T04:31:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-12T14:16:55Z","title":"MulDimIF: A Multi-Dimensional Constraint Framework for Evaluating and Improving Instruction Following in Large Language Models","version":2},"cited_work":{"arxiv_id":"2505.07591","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07591","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MulDimIF: A Multi-Dimensional Constraint Framework for Evaluating and Improving Instruction Following in Large Language Models","venue":"cs.CL","work_id":"686348af-2e9f-4cf8-b021-6019e260b9bd","year":2025},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"cited_paper":"/paper/2505.07591","citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:d8273f31df2580f4c3283a3b4a5aac9d23d4f263555b81632e0862d2b523e9b6","observation_id":"a6683023-e0d3-4c17-b03d-4789b51f2c2c","resolution":{"observed_at":"2026-05-13T20:28:14.108897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d0f4b00f-cfbb-42f0-b5d1-0c57fea350a7","year":2024},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:344438804c869e78eca9432d9171dd1b6eee2e892d4bc766372e374fa351a973","observation_id":"0b867fb8-17c9-4b7e-a075-10d84f3e9ff0","resolution":{"observed_at":"2026-05-14T01:43:39.531045Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c30ce3dd-50b7-44a1-8a16-c2733dc1699f","year":null},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:fd0fa4e4d4d3d3a4d64367e286ed2b2b756b8e2d41832274840f3446b1c1f906","observation_id":"7f708e30-c47d-496c-ab3b-0ca8427022cf","resolution":{"observed_at":"2026-05-14T01:43:39.534027Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InICML 2025 Workshop on Computer Use Agents","venue":null,"work_id":"55d486b4-4498-4503-b18b-7c9213addcac","year":2025},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:d1204190116673be32ce18b0a1cbe7ef9a9e85942f15b489f6108cab7d834a42","observation_id":"c3766f5b-4f80-4a27-beec-a4fa59ca16cb","resolution":{"observed_at":"2026-05-14T01:43:39.521167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.23457","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Replay failures as successes: Sample-efficient reinforcement learning for instruction following","venue":null,"work_id":"8a319c66-8ea1-4f54-b76e-ceb27630bfde","year":2025},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:ce0dfd391c24b00024c7eb908e530a6af8fe44cd6890ebd40e55b79fe10f2759","observation_id":"f0625b53-c2ce-4d28-a35f-c3e3a6a4fcba","resolution":{"observed_at":"2026-05-13T20:28:14.077900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dcb1b0b7-1995-45ce-ba57-a36b49cf3d9a","year":2023},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:8866cd8739e024e4bcdd28762f6de18dc169ac9122b8f9494112d24db77d61d2","observation_id":"e283548f-166c-44cd-b6ec-712ffa72b50d","resolution":{"observed_at":"2026-05-14T01:43:39.511969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"95a52414-9fdc-4b30-9725-1f72a203c127","year":2024},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:a8b8eca42553784d6bedbc929a81f2b0db5a075760645d8b3726c38199d39747","observation_id":"5a1a29bc-0348-4354-bb2c-9296616cb920","resolution":{"observed_at":"2026-05-14T01:43:39.505254Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"13da6056-284c-437f-9310-885056d946ae","year":null},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:fb594d455e9f913f591080027857556f70c99f1149e3e771a427765f2ba20921","observation_id":"532530bf-200d-4e2c-bcfd-caed5f9c56f3","resolution":{"observed_at":"2026-05-14T01:43:39.508670Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.01162","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T18:26:26.312428Z","title":"arXiv preprint arXiv:2603.01162 , year=","venue":null,"work_id":"8c22f6d7-37fc-4ebf-a2c9-1a44a697cb2f","year":2026},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:499f3f0da404b3ff460885f6adc7a38af21ef50fd74da6bf92e979250064aa9d","observation_id":"7a7b0f29-5a43-4fc9-a09c-ed739bb21792","resolution":{"observed_at":"2026-05-13T20:28:14.083158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:373a1f0dcc5ad1b5af8fc62fed4eb1193eb7a343d7cb2417b7f5576d7a0cd9fd","observation_id":"ef302106-3250-47bf-b02b-12ddd97ddcf2","resolution":{"observed_at":"2026-05-13T20:28:14.106120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16949","last_updated":"2026-08-01T14:42:28Z","snapshot_observed_at":"2026-08-05T19:41:39.839661Z","submitted_at":"2025-08-23T08:47:31Z","title":"Breaking the Exploration Bottleneck: Rubric-Scaffolded Reinforcement Learning for General LLM Reasoning","version":7},"cited_work":{"arxiv_id":"2508.16949","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.16949","snapshot_observed_at":"2026-08-04T02:23:17.018487Z","title":"Breaking the exploration bottleneck: Rubric-scaffolded reinforcement learning for general llm reasoning.arXiv preprint arXiv:2508.16949","venue":null,"work_id":"ca755e28-afae-49ff-addc-7f3dbaca0baa","year":2025},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"cited_paper":"/paper/2508.16949","citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:544b19c9a5e4805d5ee7fe850d82dd84f575b54a2b4d0f1d92f773b1445b7372","observation_id":"70f2b176-1b0c-4f14-a4d1-3641aa04ec6e","resolution":{"observed_at":"2026-08-04T02:23:17.018487Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instead, provide a thorough narrative that explains the ”how” and ”why” alongside the final result","venue":null,"work_id":"ff90b5b8-918d-4b0c-8f4f-11c1f640cb4a","year":null},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:611e012b0c10e779a71beb6c1835282b138edeaf06406f797379dda01fa6a14d","observation_id":"ba74e407-d3dd-421c-81a1-c5a96229d259","resolution":{"observed_at":"2026-05-14T01:43:39.516002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1a9aa1fc-ffba-4922-8e7e-e703289552d7","year":null},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:28a4732dd1824ad5d341b614a9475fd58189f2e1e082fb4974918287e10a3704","observation_id":"6e179cd3-3267-4af1-b724-f198f6e38f68","resolution":{"observed_at":"2026-05-14T01:43:39.478231Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"type”: “all relevant","venue":null,"work_id":"bd5ba0f4-c865-4b7d-8a8d-274a55fae00b","year":null},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:d6766429b78ed7569ebf04deffbe04991228e335206e4b7350bc185cbb9419f1","observation_id":"39b2e807-0d5f-42dc-8779-2973636beb2b","resolution":{"observed_at":"2026-05-14T01:43:39.487413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"all irrelevant","venue":null,"work_id":"1ef378e6-dd57-4379-9d77-08b5c33159dd","year":null},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:7069e0756ef33993728301df278c4ac2942802ccd378f5ded61268588dec01c8","observation_id":"224195dc-8fd9-41f9-a128-8f90b579f70a","resolution":{"observed_at":"2026-05-14T01:43:39.537106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b95d9f35-c881-4efc-9952-d5e10ca4c2a4","year":null},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:b83b7d73133cfd49a324d42d8412da858a3c9ccb9abe44addafe7c58201d1ee7","observation_id":"1275db15-06fb-437d-be14-16125455e952","resolution":{"observed_at":"2026-05-14T01:43:39.539993Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b8017982-2b34-477d-ad3d-92e607e0837f","year":null},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:87596c884c5b92de09a835c30d388ce9a0d22a3396afac0feb515a0b2d93e4de","observation_id":"117917bc-b524-4502-97dd-fd11b41728c7","resolution":{"observed_at":"2026-05-14T01:43:39.542856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3d67ebea-0f60-4b03-897f-35aedc24121f","year":null},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:1aa84c41671c84d49086a7a932f5f95e56a465fddea0bd108b40437c8fbb19b6","observation_id":"a2dd613d-b273-401d-b419-ae316a4ad7c7","resolution":{"observed_at":"2026-05-14T01:43:39.448699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8a62aab6-a8f8-4030-ae31-a92bafa9174c","year":null},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:c2bd57f346ad964433c7426ad24912c3ffa3b794dbd102a38d3a9114f52ad81b","observation_id":"d6174ad9-c59a-4584-b6f0-f93259f9f734","resolution":{"observed_at":"2026-05-14T01:43:39.494988Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fbad58a4-7bc1-4430-8918-392debd718d1","year":null},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:301f493e1be337b0923617101d98683f82b2ebaef982fb42fd15b4f95c8275b3","observation_id":"04dde211-0a9c-478e-9551-1c8fe65a64de","resolution":{"observed_at":"2026-05-14T01:43:39.558568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a6e47601-1c01-473e-8904-7d41f5087371","year":null},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:de11ba129272ac611eb68eae208e7a332b8cfd66498ff3e00ac9bcc864fadb2d","observation_id":"73c446d8-7499-4cb7-85a8-ccc1c45ee842","resolution":{"observed_at":"2026-05-14T01:43:39.462716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"D Inter-Sample Token Group Normalization We first provide a formal definition ofInter-Sample Token Group Normalization, the baseline strategy discussed in Section 3.2","venue":null,"work_id":"b4aeafee-7014-4abc-838e-ab4e78316e53","year":null},"citing_paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T20:24:17.788697Z"},"links":{"citing_paper":"/paper/2604.02795"},"observation_digest":"sha256:db2db10a96c16c7b52ad5683020d8579c6ad6ae42f0a2beb9e4cc58f28d8a604","observation_id":"e91821cb-f40e-4675-8fe7-1df6372689b3","resolution":{"observed_at":"2026-05-14T01:43:39.468702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.02795","last_updated":"2026-04-03T07:02:57Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:02:57Z","title":"Rubrics to Tokens: Bridging Response-level Rubrics and Token-level Rewards in Instruction Following Tasks"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":23,"verified_exact":17,"verified_fuzzy":5},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 3 inbound Pith citation observations for arXiv:2604.02795."}