{"as_of":"2026-08-09T21:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:46584da159042ca3b2a81ae1ccc5d7b7e0944675ae114410a592fe79fa9e9bc5","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-30T13:09:01.611455Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23771/citation-record","integrity":"/paper/2607.23771/integrity","json":"/paper/2607.23771/citation-record.json","paper":"/paper/2607.23771"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.140351Z","title":"ICLR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.140351Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:b6a68b60be7eb6a70b8a908672c996d0f99e54228e7295d341857e79f4fbb248","observation_id":"6c78d2e7-e099-4f19-8172-b1b0231f336c","resolution":{"observed_at":"2026-07-30T13:09:01.140351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15254","last_updated":"2025-06-10T21:52:15Z","snapshot_observed_at":"2026-07-06T19:20:37.430389Z","submitted_at":"2024-09-23T17:53:42Z","title":"Archon: An Architecture Search Framework for Inference-Time Techniques","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15254","snapshot_observed_at":"2026-07-30T13:09:01.315112Z","title":"arXiv preprint arXiv:2409.15254 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.315112Z"},"links":{"cited_paper":"/paper/2409.15254","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:8b93c8c18b70a4f1afa0a0a709e69297389ee48313d054e282b7fa65e5158d69","observation_id":"ca84f8fd-c60f-428b-904f-f3f75915a05d","resolution":{"observed_at":"2026-07-30T13:09:01.315112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.322126Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.322126Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:af7789ebd68b1fcb2873559a08e9b4001587a623785a7731b115c9a8341084ba","observation_id":"7b93cefa-50e9-48a4-b98e-a0a6c280c32a","resolution":{"observed_at":"2026-07-30T13:09:01.322126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.329861Z","title":"Journal of Machine Learning Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.329861Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:85f185bda6ab17345f368996bfcebc4340d6ab9a26e9de1fa336c764690b83be","observation_id":"b5123d1d-8630-4702-a6f6-7991a5ca647d","resolution":{"observed_at":"2026-07-30T13:09:01.329861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-30T13:09:01.337196Z","title":"arXiv preprint arXiv:2302.13971 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.337196Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:aaaf8db9109889d0b1b239c02c46c6dcef0d9932dddeea399cbb2bf69f802f65","observation_id":"3a19ecd9-eabf-40da-825e-a3e54afba3ac","resolution":{"observed_at":"2026-07-30T13:09:01.337196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.346978Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.346978Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:be230e8ef11268d3b36f021aa78eca819b5e6858f4464cfe1c65631b675bf68a","observation_id":"1e738410-959f-4b10-8d74-431f0c3b483c","resolution":{"observed_at":"2026-07-30T13:09:01.346978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.360370Z","title":"ICLR , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.360370Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:7571a77c2961362f904d311a111f2d3b443dfc8c310202781412ae6e8b83a5ba","observation_id":"c7f48261-a220-4f5c-9c2b-5383278f5d11","resolution":{"observed_at":"2026-07-30T13:09:01.360370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.365775Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.365775Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:2b157ca20ba800c64115039b088cef1f07402009565bbba62c6b590a49f8d1a3","observation_id":"20596af4-e8e8-4094-8d98-e778e0574280","resolution":{"observed_at":"2026-07-30T13:09:01.365775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06117","last_updated":"2024-03-12T04:38:27Z","snapshot_observed_at":"2026-07-06T16:30:08.320348Z","submitted_at":"2023-10-09T19:48:55Z","title":"Take a Step Back: Evoking Reasoning via Abstraction in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06117","snapshot_observed_at":"2026-07-30T13:09:01.372470Z","title":"arXiv preprint arXiv:2310.06117 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.372470Z"},"links":{"cited_paper":"/paper/2310.06117","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:d6fdf154b0b5a5aef529ec8955a17a3bcbb026a0f390f651082e523d5b0fd651","observation_id":"4debd1c6-de6d-4732-8f2b-35f435005107","resolution":{"observed_at":"2026-07-30T13:09:01.372470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.378665Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.378665Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:1a6d139b1783c14e72e9804e91c9dd0c0be838ab556fda02637c48089d82fabb","observation_id":"94b5318e-ccc8-4604-a9cd-82c8a86ec17d","resolution":{"observed_at":"2026-07-30T13:09:01.378665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.388738Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.388738Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:325f206d701c2c516f20799afecaa71e659e3ff253687565365098b0688feaf9","observation_id":"be22f277-4529-4844-83ea-270d04bc0b0a","resolution":{"observed_at":"2026-07-30T13:09:01.388738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.394540Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.394540Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:7abefd84b1ce380500c992b127ed989be872d59d282902d6b77e394850ad73d4","observation_id":"b70bd16d-a3e8-419c-956f-3601aea614a4","resolution":{"observed_at":"2026-07-30T13:09:01.394540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.402002Z","title":"The eleventh international conference on learning representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.402002Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:ed419a088c71fa4f9c56503d3e00f59101cd862e08bc036959474da6c764bd2f","observation_id":"2660c7b4-92ae-498e-b3a6-fe0d8bc9df4b","resolution":{"observed_at":"2026-07-30T13:09:01.402002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.412757Z","title":"Forty-first International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.412757Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:c9ec48fb4c37c9b6e2c9f02be27fed11823e462c98fa0985b7efa31b34ddc1e7","observation_id":"68d856c6-c55f-4b66-9448-2dd1df925d1e","resolution":{"observed_at":"2026-07-30T13:09:01.412757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.422394Z","title":"Proceedings of the 36th annual acm symposium on user interface software and technology , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.422394Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:8f91f916340f238159824a00050b6e02dd443837a2de67aefb2ba16f1aa35573","observation_id":"14a34fbc-0f7c-49b1-9655-fe6319ec4eb1","resolution":{"observed_at":"2026-07-30T13:09:01.422394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.429179Z","title":"Frontiers of Computer Science , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.429179Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:6264c502f0f60b4e8360a23b7a16eaebec7345ae00b95b257c538235546a3adc","observation_id":"6eb1e7a9-2c5e-46c7-80e3-e753fe283e30","resolution":{"observed_at":"2026-07-30T13:09:01.429179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.435895Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.435895Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:7c5480859ea568d872662d29feb7f9fc62938b5e65907fd38696f974709d7f5d","observation_id":"f976b26c-9037-46d2-97e2-ef68fc8ab99f","resolution":{"observed_at":"2026-07-30T13:09:01.435895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-30T13:09:01.442871Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.442871Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:c9ab5f029b6a94479badbaf5c99e50b68ec22b0e9b60e30f20b1e9e9f097dfe2","observation_id":"9132fb83-fa0d-4019-ae13-4465faf03e7a","resolution":{"observed_at":"2026-07-30T13:09:01.442871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03262","last_updated":"2025-11-10T15:11:13Z","snapshot_observed_at":"2026-08-02T05:27:47.490711Z","submitted_at":"2025-01-04T02:08:06Z","title":"REINFORCE++: Stabilizing Critic-Free Policy Optimization with Global Advantage Normalization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03262","snapshot_observed_at":"2026-07-30T13:09:01.449377Z","title":"arXiv preprint arXiv:2501.03262 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.449377Z"},"links":{"cited_paper":"/paper/2501.03262","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:f27680de9c5830f89a1fc0809527034a28d76426bc7c484e60b20eadca532f48","observation_id":"0c24fb04-ec27-4636-b78b-8b505f780e2a","resolution":{"observed_at":"2026-07-30T13:09:01.449377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09501","last_updated":"2025-05-27T03:22:35Z","snapshot_observed_at":"2026-08-07T17:09:42.953110Z","submitted_at":"2025-03-12T16:05:31Z","title":"ReMA: Learning to Meta-think for LLMs with Multi-Agent Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09501","snapshot_observed_at":"2026-07-30T13:09:01.454452Z","title":"arXiv preprint arXiv:2503.09501 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.454452Z"},"links":{"cited_paper":"/paper/2503.09501","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:a387569764b3ca2ea7ef23586cea3769a545b94b9ceae28b0d8c126dd62d11d6","observation_id":"cf496511-afe6-448c-aa03-daec8daf50ec","resolution":{"observed_at":"2026-07-30T13:09:01.454452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20073","last_updated":"2025-05-26T17:19:30Z","snapshot_observed_at":"2026-08-08T11:44:11.313729Z","submitted_at":"2025-04-24T17:57:08Z","title":"RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20073","snapshot_observed_at":"2026-07-30T13:09:01.459582Z","title":"arXiv preprint arXiv:2504.20073 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.459582Z"},"links":{"cited_paper":"/paper/2504.20073","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:4103e01afc9a423693ac34a11b1b42c8ecf06c4b37258bda54133dbc5eda1b0a","observation_id":"887ac30f-d76b-4c8e-b766-fa3ca5e62038","resolution":{"observed_at":"2026-07-30T13:09:01.459582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09671","last_updated":"2024-10-12T23:42:16Z","snapshot_observed_at":"2026-08-08T14:45:36.681932Z","submitted_at":"2024-10-12T23:42:16Z","title":"OpenR: An Open Source Framework for Advanced Reasoning with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09671","snapshot_observed_at":"2026-07-30T13:09:01.465751Z","title":"arXiv preprint arXiv:2410.09671 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.465751Z"},"links":{"cited_paper":"/paper/2410.09671","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:d4f52002f10e7bd3bb3e30167aac0f61126640e94d96b0782da4e2dae97351e2","observation_id":"891041d3-db42-44b2-a955-5a82bae94216","resolution":{"observed_at":"2026-07-30T13:09:01.465751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.470761Z","title":"First Workshop on Multi-Turn Interactions in Large Language Models , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.470761Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:fc13f50301ea515217bc56cde743d217d9ef22ff73ed53d064a48ff20fa184ea","observation_id":"cc7cb7c4-7700-4d6d-ad54-8c62657fdf0e","resolution":{"observed_at":"2026-07-30T13:09:01.470761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.475397Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.475397Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:28576277eadd4bfb7a77d7457c607aa556b4cae6ff1a9003db65eaa59fde0299","observation_id":"17cc6985-5b85-4b56-b1be-bc751d865fb2","resolution":{"observed_at":"2026-07-30T13:09:01.475397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.480055Z","title":"Advances in Neural Information Processing Systems , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.480055Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:b54b60ae698d661ea962a680638d0081f27e332fb884b1518d2f393a0eeda66f","observation_id":"c8881e43-04e8-491d-a9c1-28dfc9ebd689","resolution":{"observed_at":"2026-07-30T13:09:01.480055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.484477Z","title":"arXiv preprint arXiv:1707.0183 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.484477Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:ab2317e914c21abfd09965d5bbe34f2e093cc4925cdd04c25134543b66680a20","observation_id":"e5d95851-17fd-4f6a-9d1c-af4be63cb3ef","resolution":{"observed_at":"2026-07-30T13:09:01.484477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.489240Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.489240Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:9919357e0ea57bd0ea4788add6ef4ed458f87e4e2d63c8ed5f7095521df884ac","observation_id":"6fec7fbb-a568-4831-bd87-6f82d34b61f4","resolution":{"observed_at":"2026-07-30T13:09:01.489240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.493460Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.493460Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:2b40189a49d24131096ddb47930f23a27c732d5f23c14d0510ff43c32ea0ee50","observation_id":"e5d41949-540d-499d-8815-43c2a54ee1f9","resolution":{"observed_at":"2026-07-30T13:09:01.493460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.497938Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.497938Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:a642daab28d808defed0878599ed632bc6f795784c1dcd3ae4aad1dd81a65395","observation_id":"66d5b022-2b53-4c36-8ab8-490b05e51b79","resolution":{"observed_at":"2026-07-30T13:09:01.497938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.503033Z","title":"Machine Learning , volume =","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.503033Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:c424aad1acc719cb35250b4cdaed564793b35a186e09082c99f033f70756e132","observation_id":"42656563-6928-4e1d-a1ef-e248da4500d3","resolution":{"observed_at":"2026-07-30T13:09:01.503033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.508598Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.508598Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:d2fc209765b780498b8a1798115f22136bb96ae202b10367282f555e4f2fe8c7","observation_id":"cf1bd968-fa94-4ad5-9a3d-c23b2a840a57","resolution":{"observed_at":"2026-07-30T13:09:01.508598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.512924Z","title":"Advances in Neural Information Processing Systems , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.512924Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:e23331a700aa99db912d115967150eb7f81beccbb102a43adc289b11f8858cc4","observation_id":"b1c610ad-18ec-4865-8024-9c44eb76b87a","resolution":{"observed_at":"2026-07-30T13:09:01.512924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.517473Z","title":"International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.517473Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:aee8ed7b29efe003b144ec29b221ab625bdc65814cd32621069ffff311f3545e","observation_id":"a78c7e02-9092-4f58-b351-577f590a141b","resolution":{"observed_at":"2026-07-30T13:09:01.517473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.524146Z","title":"International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.524146Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:249a748cc0e7d53a05642051e6d519003567d75149b6cd8f270b2af7a6f2a02a","observation_id":"cac65229-2fb3-4917-81e1-388098665356","resolution":{"observed_at":"2026-07-30T13:09:01.524146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.531993Z","title":"2017 IEEE international conference on robotics and automation (ICRA) , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.531993Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:38062bc92e1a13e3a8d56fef3006f8f344bd48ba66af17b6bf12d1359d9730dc","observation_id":"941cdb94-fc70-4df3-bb49-4bcfeb870a0c","resolution":{"observed_at":"2026-07-30T13:09:01.531993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.539836Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.539836Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:9ec83a181dd5f81a73c7bff29d3ebd420c86f35868ecfd26a26b84ef9f217c9e","observation_id":"e2b06f8d-286b-4768-b22b-7e4663fd6beb","resolution":{"observed_at":"2026-07-30T13:09:01.539836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.545438Z","title":"International Conference on Learning Representations , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.545438Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:af934b002e84791b8b6a17361a9fcce09088a9e3cd226b4cf774456dc32a0df9","observation_id":"1cec27f7-a7d7-4d98-97e6-fd63bf66dd58","resolution":{"observed_at":"2026-07-30T13:09:01.545438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.551057Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.551057Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:37e22ebbbed88b0854e9cf2432f57256377e6ea2e339be57eed4c1f5b3a36baa","observation_id":"7c91183d-5383-41de-972e-d01c05f9adce","resolution":{"observed_at":"2026-07-30T13:09:01.551057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-30T13:09:01.571206Z","title":"arXiv preprint arXiv:2110.14168 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.571206Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:0bc2fe7d9da2ab88e0e38c439a46df36d6dfca5a0f24be1cc4ea3dc8a4d50775","observation_id":"07db6699-02c4-4e52-8028-774128613a01","resolution":{"observed_at":"2026-07-30T13:09:01.571206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-30T13:09:01.579004Z","title":"arXiv preprint arXiv:2407.21783 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.579004Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:a2b6a09f018c18e42f01506d4359e55addd70a47143743fb684902fc093c8891","observation_id":"82690ad4-d66d-438c-a4ea-726c517bac68","resolution":{"observed_at":"2026-07-30T13:09:01.579004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-07-30T13:09:01.584422Z","title":"arXiv preprint arXiv:2103.03874 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.584422Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:e04ecb2c1fc8a09916744d20b14093608ea6dc81c11d3bc6dd2bd971996c1a9e","observation_id":"e451daaa-79de-436f-8b79-58ea83e3dcf3","resolution":{"observed_at":"2026-07-30T13:09:01.584422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.590286Z","title":"The twelfth international conference on learning representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.590286Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:afaa2fa9787c11b4ffef35982f7f3f31b318ba64f2ec5d49ad2b10c85741abb7","observation_id":"02aa038c-b899-4fd5-a8f6-b89c730b4a6d","resolution":{"observed_at":"2026-07-30T13:09:01.590286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.601707Z","title":"2024 , howpublished =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.601707Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:bc0c08701ab118c60034a5fbe643236eef53eed2b11bc0a6b2bc7fff36737d08","observation_id":"f8831cb2-63d6-43ef-9b71-890012c20cd7","resolution":{"observed_at":"2026-07-30T13:09:01.601707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.606330Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.606330Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:0bf6480f0c26ee3b69bbe86b9f1dab715403b7b6240b7f916766af0f8c738ec2","observation_id":"c3fb2c9f-a007-4c47-b90b-bf38db6d8961","resolution":{"observed_at":"2026-07-30T13:09:01.606330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-30T13:09:01.611455Z","title":"International conference on machine learning , pages=","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-30T13:09:01.611455Z"},"links":{"citing_paper":"/paper/2607.23771"},"observation_digest":"sha256:7ce2a2c954f208dd13450d4ccbe01d43a66e644b96022c3a7b8ac307e12679ce","observation_id":"87764391-feb3-4980-91b2-315e5cc4c3ad","resolution":{"observed_at":"2026-07-30T13:09:01.611455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23771","last_updated":"2026-07-26T17:44:33Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T20:07:46.849620Z","submitted_at":"2026-07-26T17:44:33Z","title":"Training Language Models to Cooperate with Inference-Time Controllers"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2607.23771."}