{"as_of":"2026-08-09T14:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc8aef0876bcf458836ab67571cca06f4fe89bb15813dbfa3c8d7095bbadf6d0","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T22:31:18.616099Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T07:05:47.150308Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04517","snapshot_observed_at":"2026-07-12T07:05:47.150308Z","title":"arXiv preprint arXiv:2502.04517 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.02781","last_updated":"2026-07-02T21:27:59Z","snapshot_observed_at":"2026-08-02T20:53:24.751933Z","submitted_at":"2026-07-02T21:27:59Z","title":"Safe Inference-Time Alignment via Lagrangian Reward Augmentation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-12T07:05:47.150308Z"},"links":{"cited_paper":"/paper/2502.04517","citing_paper":"/paper/2607.02781"},"observation_digest":"sha256:d6981c355740108a66e32fe7cddcc197516faaedb475241416deef3079212405","observation_id":"6c1f8641-65bc-4e7e-ab35-8ea5357eab5e","resolution":{"observed_at":"2026-07-12T07:05:47.150308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04517/citation-record","integrity":"/paper/2502.04517/integrity","json":"/paper/2502.04517/citation-record.json","paper":"/paper/2502.04517"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-08T22:31:18.450643Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.450643Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:2474fa7ecbca0f34cc03b58edb158333b9ef232c1e59fc7980278a75b32561fa","observation_id":"59aafdef-8cf4-4d7d-a14b-6ccacfa308b6","resolution":{"observed_at":"2026-08-08T22:31:18.450643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.275690Z","title":null,"venue":null,"work_id":"78c15d06-1147-416d-a0a1-5e27345652fc","year":1952},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.455537Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:8e97be93b4cd625b586b62f18aefddc71999efdaadfe899bdca320347b3d2a38","observation_id":"ccf7776c-207c-47e2-a62b-16ee3fa8ef1e","resolution":{"observed_at":"2026-08-08T22:31:19.279332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.265754Z","title":"Beyond sparse rewards: Enhancing reinforcement learning with language model critique in text generation, 2024","venue":null,"work_id":"a1930192-7250-4a15-85b3-0e24031734fd","year":2024},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.459421Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:7f5efdcbe981a905e4f118ae7e757738ec96cdb8d57505f51ce8c09ad67be8c2","observation_id":"8ed0eb1d-e2cf-4133-8fbf-377540eb4a55","resolution":{"observed_at":"2026-08-08T22:31:19.269384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.255443Z","title":"PPL-MCTS : Constrained textual generation through discriminator-guided MCTS decoding","venue":null,"work_id":"72f7073c-df3f-4204-a279-4ad508f76079","year":2022},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.463866Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:984df269e8253e730bbdff027415a38c3d879be8b0c2f23cb1004e28eab25c10","observation_id":"1f347e93-5f45-4724-8feb-98ad11f76c95","resolution":{"observed_at":"2026-08-08T22:31:19.259008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.245246Z","title":"E., Stoica, I., and Xing, E","venue":null,"work_id":"c9aadd8c-c523-4597-9ecd-93172a618a89","year":2023},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.467925Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:c01a65e2b174b8c634e20e9cc3d224c01278e221effcaaeb0ebdf62b095b4cfd","observation_id":"5a0af50e-0989-478d-9661-7a418d9a41d4","resolution":{"observed_at":"2026-08-08T22:31:19.248780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.235340Z","title":"F., Leike, J., Brown, T., Martic, M., Legg, S., and Amodei, D","venue":null,"work_id":"7aea3559-8b82-45c3-bd40-5e33e85757a5","year":2017},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.471650Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:7400585f3bb2e5b6523e94a7f0ded9b18bae215689307e9d91df789054288524","observation_id":"75a215f7-23c1-48f2-8136-eb3f0dc4ea72","resolution":{"observed_at":"2026-08-08T22:31:19.238834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.225558Z","title":"Plug and play language models: A simple approach to controlled text generation","venue":null,"work_id":"8e668dce-16b9-40c3-b678-54a700d96f44","year":2019},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.475588Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:24e73ea63feb6c010a106033c72637851da115ae54d4748b4a8d6e8862ccc07f","observation_id":"5620212e-1ffe-4e32-b671-bd941a051b9e","resolution":{"observed_at":"2026-08-08T22:31:19.229088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.215506Z","title":"and Raffel, C","venue":null,"work_id":"6bb5e1d6-8d74-4d3c-8ee3-30f4e4abbd09","year":2023},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.479221Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:8febf34b6f486ab531ae54c1a8f5d133cba27d6526e41314375a3ebaba99b453","observation_id":"fc60ab86-d1d2-41ed-b144-d9c84b1049d7","resolution":{"observed_at":"2026-08-08T22:31:19.218856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.205725Z","title":"RAFT : Reward ranked finetuning for generative foundation model alignment","venue":null,"work_id":"f611a21d-8c51-4d2c-92b7-b4ae4b45a266","year":2023},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.482892Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:4e5d3da3250d1296151d82643e45e204c1f5bc3ba2537cdb15e2cef9a2a511e8","observation_id":"c5d91caa-9cf5-423b-9742-6d38d6a32b96","resolution":{"observed_at":"2026-08-08T22:31:19.209195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.195478Z","title":"Hierarchical neural story generation","venue":null,"work_id":"7b53dd22-e751-4060-96e3-39257c2f3ce6","year":2018},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.486379Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:a659f38000bb78771dc41104a1b95d03928dd078fa47c66ef802be8d61909b68","observation_id":"509134cd-bc14-46e9-8345-25c4fbfbe2be","resolution":{"observed_at":"2026-08-08T22:31:19.199271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.185476Z","title":"Y., Ding, N., Yao, G., He, B., Zhu, W., Ni, Y., Xie, G., Xie, R., Lin, Y., Liu, Z., and Sun, M","venue":null,"work_id":"9903414a-0bae-463c-8368-44d43ee597df","year":2024},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.489659Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:a497b4ef6cd01b3694ed400c75142c2fc17ed7f8c7a4fdba455b80687550c073","observation_id":"3090a537-f00b-4fac-8c38-9df9be402e5d","resolution":{"observed_at":"2026-08-08T22:31:19.188991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06639","last_updated":"2024-05-10T17:59:04Z","snapshot_observed_at":"2026-07-06T18:12:43.301678Z","submitted_at":"2024-05-10T17:59:04Z","title":"Value Augmented Sampling for Language Model Alignment and Personalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06639","snapshot_observed_at":"2026-08-08T22:31:18.493155Z","title":"Value augmented sampling for language model alignment and personalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.493155Z"},"links":{"cited_paper":"/paper/2405.06639","citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:52614817c270279c59a82205cb9b52a6822688ddae0d7bd12772ac986ac9c77c","observation_id":"5960b33a-5423-454c-b3b5-304c808177ca","resolution":{"observed_at":"2026-08-08T22:31:18.493155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.175820Z","title":"The curious case of neural text degeneration","venue":null,"work_id":"350a8e0c-de8a-428f-b6bd-7213c294eadc","year":2020},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.496954Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:f77a76be583d7316330d17ea65c8320988394fc8a8e0e6fe5d76f2ea915e4534","observation_id":"65b9bbd9-f6db-4eb8-a03b-bf6665936af0","resolution":{"observed_at":"2026-08-08T22:31:19.179341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.165490Z","title":"Grace: Discriminator-guided chain-of-thought reasoning","venue":null,"work_id":"e4986a8a-cc80-4748-9be2-6180eaf17f10","year":2023},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.500310Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:be96ac04690aacffeda68f1a843bb58ec6dd1b91a8542fe52eccdad32f52dcaa","observation_id":"bf01457a-519d-46ca-98af-3e1816fa78fe","resolution":{"observed_at":"2026-08-08T22:31:19.169062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.155312Z","title":"Alignment as reward-guided search","venue":null,"work_id":"6ae1b2ea-2b02-4c42-8a1b-4b3736d78545","year":2024},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.503604Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:1268acc349dd2430115d8c66f86f42809dc4e817a781d9afa558ca893149a980","observation_id":"21523dc2-3cca-404e-ae86-23ed838c5c98","resolution":{"observed_at":"2026-08-08T22:31:19.158841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.145150Z","title":"D., McCann, B., Keskar, N","venue":null,"work_id":"d6b14ab7-a92b-4151-9f9e-28fc157924ac","year":2021},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.507222Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:d15e44339740388feaf4fac865e5ec36916d02157886bef033b45df241047ed1","observation_id":"25d90cbf-b1bd-418f-bff5-8c1a85066e91","resolution":{"observed_at":"2026-08-08T22:31:19.148664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.134787Z","title":"Rankgen: Improving text generation with large ranking models","venue":null,"work_id":"dc5f51c3-aece-4eed-9113-e8b324df75ae","year":2022},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.510521Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:6ac2dcd6a38b002c589dc058aabbe65ee064eb9375edfaa06e65422b2bd75794","observation_id":"547d1eb9-0864-4337-9dcd-a475f1ef69c4","resolution":{"observed_at":"2026-08-08T22:31:19.138517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.124843Z","title":"M., and Abbeel, P","venue":null,"work_id":"a230a2ef-19f8-4c85-8805-abd90d8e5f44","year":2021},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.513941Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:981950312a39bfd17987cd40f62342df5e8b822fe0574704d9624cbbfc28aad4","observation_id":"80f2c0ed-e2aa-404a-b4f3-e82a0582b0a5","resolution":{"observed_at":"2026-08-08T22:31:19.128269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16306","last_updated":"2025-08-03T22:12:55Z","snapshot_observed_at":"2026-07-06T18:35:45.699877Z","submitted_at":"2024-06-24T04:08:35Z","title":"Cascade Reward Sampling for Efficient Decoding-Time Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16306","snapshot_observed_at":"2026-08-08T22:31:18.517650Z","title":"Cascade reward sampling for efficient decoding-time alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.517650Z"},"links":{"cited_paper":"/paper/2406.16306","citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:047f6933620c242535c57a440237038d5f74d11785c22cf4c4e6936497abe8a9","observation_id":"49c8c75d-139c-4ae6-9083-4241e8858954","resolution":{"observed_at":"2026-08-08T22:31:18.517650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.114061Z","title":"Making language models better reasoners with step-aware verifier","venue":null,"work_id":"5b99aba3-11dc-4524-a6ba-e649538fc656","year":2023},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.522822Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:61f682d698bcbd40b44a4e6580df888c130bcb4b27d83523aaa9d8a604c22ec9","observation_id":"c8f01739-9745-4df8-9f29-48d9363f98e2","resolution":{"observed_at":"2026-08-08T22:31:19.118181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.103254Z","title":"Let's verify step by step","venue":null,"work_id":"2ed29e18-10d8-41b9-80a7-3f25f595486c","year":2023},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.526718Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:0d07f5cfdf65b5c5bccba68b1cdca29440d92f7c720427363556f4d189d81d94","observation_id":"04a3e171-54e3-4267-b16a-d51ab3671c33","resolution":{"observed_at":"2026-08-08T22:31:19.106760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.092678Z","title":"Chain of hindsight aligns language models with feedback","venue":null,"work_id":"899f727d-8fce-433f-8f46-39719042d0b9","year":2023},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.530198Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:2c4d4ff116be1e4c3ce4bb1d3effb39ddfb5bdd7d21dad6ff06940dd071cfa73","observation_id":"f6be779a-9142-40ab-9bd7-d0479da095a1","resolution":{"observed_at":"2026-08-08T22:31:19.096410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.081041Z","title":"Attribute controlled dialogue prompting","venue":null,"work_id":"35d3549a-391f-4ca7-be3c-2c3f5adf2aa4","year":2023},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.533949Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:0429ef55e49ac6ddcb20f4e4ed1b1a1db53bd28061203b4bf6eb455345f446aa","observation_id":"ba63e888-674b-477a-90e6-7f9e1771cabb","resolution":{"observed_at":"2026-08-08T22:31:19.084913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.070160Z","title":"Controlled decoding from language models","venue":null,"work_id":"85bd1b6a-93fd-4fdd-9b72-60d6bb5205f1","year":2024},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.538404Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:9ad8f39689ff7942ab27f52df3ea82b85221c2f076edead017dda46f5b55f975","observation_id":"8a0740cc-35c5-44bf-9290-9cd4b77477c3","resolution":{"observed_at":"2026-08-08T22:31:19.073861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09332","last_updated":"2022-06-01T19:08:11Z","snapshot_observed_at":"2026-08-07T17:14:39.278754Z","submitted_at":"2021-12-17T05:43:43Z","title":"WebGPT: Browser-assisted question-answering with human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09332","snapshot_observed_at":"2026-08-08T22:31:18.541942Z","title":"Webgpt: Browser-assisted question-answering with human feedback","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.541942Z"},"links":{"cited_paper":"/paper/2112.09332","citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:031d3270b9da9156932bd8da0869f49881fc09ad078d7ecc97fcf361db99568b","observation_id":"68234a0f-0b61-4160-90f4-d1ac571ed533","resolution":{"observed_at":"2026-08-08T22:31:18.541942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.059025Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"ea762625-c110-4e9a-9bd0-631dd976ea88","year":2022},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.545658Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:91835947af1d7d0f1b6f42345248f2ba2456290e57bb35913811bfac58ec6219","observation_id":"9ccd0d22-e5ab-4a45-bba7-13b6c721280f","resolution":{"observed_at":"2026-08-08T22:31:19.062983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:18.548944Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.548944Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:5cddd916853bd09432b772e077a36c6269da4c4a3b271f3bfb0fbd312d53a079","observation_id":"7f15150a-e4c5-4c72-a086-b4db42715ec5","resolution":{"observed_at":"2026-08-08T22:31:18.548944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12358","last_updated":"2024-08-12T21:13:35Z","snapshot_observed_at":"2026-07-06T18:02:19.428801Z","submitted_at":"2024-04-18T17:37:02Z","title":"From $r$ to $Q^*$: Your Language Model is Secretly a Q-Function","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12358","snapshot_observed_at":"2026-08-08T22:31:18.552875Z","title":"From r to Q^* : Your language model is secretly a Q -function","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.552875Z"},"links":{"cited_paper":"/paper/2404.12358","citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:18cad50bb7f45ac80c60af5f62de8ce72bbfabb5159f7243a134ee8857a3db0f","observation_id":"532d3ac3-bd2e-43fc-9a3e-a5673f4f9430","resolution":{"observed_at":"2026-08-08T22:31:18.552875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:18.556893Z","title":"A critical look at tokenwise reward-guided text generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.556893Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:596bb0803f2dd2a265477da121ab4f2230bc6f032b9a6632c65508e4a75e06f1","observation_id":"d48a2270-fadc-45bd-b3de-a0c049828a52","resolution":{"observed_at":"2026-08-08T22:31:18.556893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-08T22:31:18.560438Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.560438Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:b747aafd59715b8b729fbb3a3acc41c61a73514c7734b82122bd798539c4522f","observation_id":"bbba2a2a-f5cb-4ce4-bc7c-8912f0f92282","resolution":{"observed_at":"2026-08-08T22:31:18.560438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11871","last_updated":"2023-05-01T04:42:27Z","snapshot_observed_at":"2026-08-04T02:07:56.186059Z","submitted_at":"2022-06-05T18:38:42Z","title":"Offline RL for Natural Language Generation with Implicit Language Q Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11871","snapshot_observed_at":"2026-08-08T22:31:18.563950Z","title":"Offline RL for natural language generation with implicit language Q learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.563950Z"},"links":{"cited_paper":"/paper/2206.11871","citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:fae1fddf210af695f41e207d5be0d498b42c5b6a49876ce6b2cf1ec3b7ec6db6","observation_id":"6671bc15-ff5f-4021-9b52-8f235c747b07","resolution":{"observed_at":"2026-08-08T22:31:18.563950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:18.567671Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.567671Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:fe1fcbf10cb048942e270709f6bbbfeb04f81d5b4448933e281b9f997eb6022d","observation_id":"67ef66ee-a1eb-47fa-8995-f94f18ab9d0d","resolution":{"observed_at":"2026-08-08T22:31:18.567671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.036205Z","title":null,"venue":null,"work_id":"d742380d-46b9-4daf-a22f-deab4de0a048","year":2020},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.571054Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:19b3c38a3dec67dcb522cb7948e9300211e351872c0b2dd8d85b19b5f245435f","observation_id":"95675154-baed-4e42-8020-9fa8e19e02eb","resolution":{"observed_at":"2026-08-08T22:31:19.039511Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.14275","last_updated":"2022-11-25T18:19:44Z","snapshot_observed_at":"2026-08-01T02:16:43.109337Z","submitted_at":"2022-11-25T18:19:44Z","title":"Solving math word problems with process- and outcome-based feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.14275","snapshot_observed_at":"2026-08-08T22:31:18.574561Z","title":"Solving math word problems with process-and outcome-based feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.574561Z"},"links":{"cited_paper":"/paper/2211.14275","citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:68bbee5699dddd96da266107d6109edb5fc9da3f5a76425e28afef73e22e2ff2","observation_id":"afa5a19a-35f6-4854-8124-7b1c788343bd","resolution":{"observed_at":"2026-08-08T22:31:18.574561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.024459Z","title":"Tl; dr: Mining reddit to learn automatic summarization","venue":null,"work_id":"eb482e90-ab2d-4235-8ccd-a08d18ebfcda","year":2017},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.578670Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:6973712da7f0b8b5bf3a9d6c3f109ba4425f287bebf03a6882e2b0dc6dd5de38","observation_id":"b24b40cb-27b7-4804-a2b1-f5218e7a8d0c","resolution":{"observed_at":"2026-08-08T22:31:19.028739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.014719Z","title":"W., Lester, B., Du, N., Dai, A","venue":null,"work_id":"73b861a5-cebf-4f3e-bc4a-b662959e0449","year":2021},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.582273Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:661c5db10c8c31f9c138a0bf4d93879755532e8c051a49bc1548c4374bb8f906","observation_id":"f1679c7a-95f9-4e0c-9276-d65f7121ce28","resolution":{"observed_at":"2026-08-08T22:31:19.018156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:19.003074Z","title":"Naturalprover: Grounded mathematical proof generation with language models","venue":null,"work_id":"73d4144a-0cea-42ae-9237-d3fbe1c878cc","year":2022},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.586079Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:383b73eed30a32052c4cd762e232eb4fabaf227b7c3549a27a867ab80af4c46c","observation_id":"f694427f-9c12-4ecd-b33f-69b7bb83d72a","resolution":{"observed_at":"2026-08-08T22:31:19.006929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:18.992156Z","title":"A., Ostendorf, M., and Hajishirzi, H","venue":null,"work_id":"cf1d24f7-e152-4444-b647-89e340b0178d","year":2023},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.589690Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:bebfd4afb52df3051f1e822ffd4b82c53bf763abd6cb01e5c1a58116db75f438","observation_id":"bcefc0ab-d6ba-4ad7-a617-06f04c063e0a","resolution":{"observed_at":"2026-08-08T22:31:18.995635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:18.980740Z","title":"and Klein, D","venue":null,"work_id":"d444240d-fc5c-44e6-b557-11308feb1a63","year":2021},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.592990Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:05fd7a9d14da702cafb96611a489424f64ded9340828673ca51aa664d4a4b5cb","observation_id":"dc2cfb28-bebf-4b09-a968-fccca63a8638","resolution":{"observed_at":"2026-08-08T22:31:18.984661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:18.968548Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":"5a8c1bcd-521f-42ca-8422-053ad021cb2d","year":2023},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.597098Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:84b53b9d693cd4eba0290fedd042550bd6c9c14e766e924b1afa7d1784c6e1f9","observation_id":"af7c8150-6ac6-4a99-8705-a7b278833f69","resolution":{"observed_at":"2026-08-08T22:31:18.972858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:18.957717Z","title":"Probabilistic inference in language models via twisted sequential M onte C arlo","venue":null,"work_id":"37fdebc4-c1e0-488a-8427-c4853516cea6","year":2024},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.601235Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:4fe373ed802d31aa31bcae08a43a0876d703946767e07a81baa7b5e0517f0d0e","observation_id":"e9a756bb-819f-4fe1-955f-64a78095ab36","resolution":{"observed_at":"2026-08-08T22:31:18.961625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:18.944347Z","title":"Judging LLM -as-a-judge with MT -bench and chatbot arena","venue":null,"work_id":"863e95db-d176-48b1-9c5c-33b78c97af3f","year":2023},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.605244Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:f8e367a9e0120219e803803fb979227526c09ac94be13bbf1b39a150bab62b65","observation_id":"2a6bbb3b-7324-44a9-a687-bcee474741cd","resolution":{"observed_at":"2026-08-08T22:31:18.949850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-08T22:31:18.612595Z","title":"M., Stiennon, N., Wu, J., Brown, T","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.612595Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:9730513bfda28dae85309f43957a3d7f7afcfb5bee8b92c4f5a88b1eeecc8f36","observation_id":"823b3df4-8700-4989-9a3f-4e6f0eb5a569","resolution":{"observed_at":"2026-08-08T22:31:18.612595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T22:31:18.616099Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T22:31:18.616099Z"},"links":{"citing_paper":"/paper/2502.04517"},"observation_digest":"sha256:9f1478f8c679266c2ab3e82111e9451c845d1c942c40fc8f1bc949e2b642c6b3","observation_id":"ef18b4f8-1230-4881-b5db-0136c7ed4abf","resolution":{"observed_at":"2026-08-08T22:31:18.616099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.04517","last_updated":"2025-07-07T02:26:24Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T22:23:39.301245Z","submitted_at":"2025-02-06T21:36:44Z","title":"Towards Cost-Effective Reward Guided Text Generation"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 1 inbound Pith citation observation for arXiv:2502.04517."}