{"as_of":"2026-08-09T18:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3ce9ac4217a4ebf3b3b9a613ba3f1bd1400802a7771e972da871aafcef50e71c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T01:04:04.069804Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:47:38.286725Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-13T08:57:22.299028Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2307.05973"},"observation_digest":"sha256:675a0198391f0050ce42fd9ea73a9057919a479258a911cb3a4c34a7fa8dfd2a","observation_id":"d23a82d5-3c8d-410b-b9e7-3dd456ea4d2c","resolution":{"observed_at":"2026-05-13T08:57:22.564735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-09T01:04:04.069804Z","title":"Reward design with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.03717","last_updated":"2025-03-31T23:24:02Z","snapshot_observed_at":"2026-08-09T00:57:31.947298Z","submitted_at":"2025-02-06T02:07:18Z","title":"Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T01:04:04.069804Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2502.03717"},"observation_digest":"sha256:2dd2493c198e2d9053518afecd3a706c616bf39f2a9932859b77edd54294e56c","observation_id":"4837da17-58ba-4590-bce9-46fbd5cafc6c","resolution":{"observed_at":"2026-08-09T01:04:04.069804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-07T15:07:04.302130Z","title":"Reward design with language models.arXiv preprint arXiv:2303.00001, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16401","last_updated":"2025-06-12T15:02:59Z","snapshot_observed_at":"2026-08-07T14:59:29.508178Z","submitted_at":"2025-05-22T08:52:21Z","title":"Divide-Fuse-Conquer: Eliciting \"Aha Moments\" in Multi-Scenario Games","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:07:04.302130Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2505.16401"},"observation_digest":"sha256:3da87b722d5853a41a56f07795b8476c50935b184cab4dd3e2540d61603e96cc","observation_id":"eedeb1d1-d01b-488b-bf83-d900cfbef269","resolution":{"observed_at":"2026-08-07T15:07:04.302130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-07T14:54:15.052114Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17249","last_updated":"2025-05-22T19:56:03Z","snapshot_observed_at":"2026-08-08T05:34:19.962571Z","submitted_at":"2025-05-22T19:56:03Z","title":"Where You Go is Who You Are: Behavioral Theory-Guided LLMs for Inverse Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:54:15.052114Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2505.17249"},"observation_digest":"sha256:0538cf9354bc4663b4e096f3214c042b5c3e809a10c92c27e6dd5f25075ea8ca","observation_id":"20383376-18c4-4a35-860a-eda6c56fc415","resolution":{"observed_at":"2026-08-07T14:54:15.052114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-07T13:53:38.843038Z","title":"Reward design with language models.arXiv preprint arXiv:2303.00001, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20671","last_updated":"2025-05-27T03:40:02Z","snapshot_observed_at":"2026-08-07T14:06:45.729132Z","submitted_at":"2025-05-27T03:40:02Z","title":"LLM-Guided Reinforcement Learning: Addressing Training Bottlenecks through Policy Modulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:53:38.843038Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2505.20671"},"observation_digest":"sha256:66431305aadadba5317c458b9553dd0bf955134dc78691de8fff944bd7ca3c12","observation_id":"e2c8dac2-a844-4e4f-a062-14f1f34ff23c","resolution":{"observed_at":"2026-08-07T13:53:38.843038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-07T12:12:54.004545Z","title":"Emotionally informed language mod- els: A study on emotion bias in text generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00312","last_updated":"2025-05-30T23:45:53Z","snapshot_observed_at":"2026-08-07T12:05:29.974731Z","submitted_at":"2025-05-30T23:45:53Z","title":"An evaluation of LLMs for generating movie reviews: GPT-4o, Gemini-2.0 and DeepSeek-V3","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:12:54.004545Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2506.00312"},"observation_digest":"sha256:f46d99c942b5a0b60da848466717166c86d4a5d7122fa0487d768b433df23da5","observation_id":"89208768-7722-478d-a081-5d8dfc6c7f02","resolution":{"observed_at":"2026-08-07T12:12:54.004545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-07T12:11:43.508406Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:43.508406Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:c05835a3956e87fbb2458dee03e507ce993f40fdea68709f62a82216bcd4daf9","observation_id":"cd972443-e59a-40ce-b06d-3303f40eea88","resolution":{"observed_at":"2026-08-07T12:11:43.508406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-07T11:50:00.420509Z","title":"Reward design with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01442","last_updated":"2026-06-26T09:06:45Z","snapshot_observed_at":"2026-08-07T11:40:24.655672Z","submitted_at":"2025-06-02T08:57:37Z","title":"Agentic Episodic Control","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:50:00.420509Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2506.01442"},"observation_digest":"sha256:0794bf89d80cc54b4eebe17b66eda1a4eac4ef7366a9cdef28aab54781772f05","observation_id":"c49e6e44-5eb9-430d-b0db-fbe209d244c6","resolution":{"observed_at":"2026-08-07T11:50:00.420509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-07T11:20:10.973403Z","title":"Reward design with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03066","last_updated":"2026-07-17T19:03:49Z","snapshot_observed_at":"2026-08-07T11:06:58.974594Z","submitted_at":"2025-06-03T16:42:39Z","title":"Sign-SZPO: Provable Preference-based Reinforcement Learning with an Unknown Link Function","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:20:10.973403Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2506.03066"},"observation_digest":"sha256:7609d28eff5c59478c562e49ad825112c884b00dffc4ad63bb29edbf7e38f47a","observation_id":"de54f59e-6712-4905-8a83-7fe6714d6b9d","resolution":{"observed_at":"2026-08-07T11:20:10.973403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-06T22:34:08.994748Z","title":"Reward design with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21250","last_updated":"2025-06-26T13:35:53Z","snapshot_observed_at":"2026-08-09T18:24:37.934285Z","submitted_at":"2025-06-26T13:35:53Z","title":"ACTLLM: Action Consistency Tuned Large Language Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:08.994748Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2506.21250"},"observation_digest":"sha256:563d94f2362d6cfb07eb4b2769b9c33592d8b16a89055111e1588b37a4917263","observation_id":"0e6cf36c-3d6b-4d3e-a5a5-6284597625a8","resolution":{"observed_at":"2026-08-06T22:34:08.994748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-06T17:39:45.103900Z","title":"Reward design with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10284","last_updated":"2025-07-14T13:51:28Z","snapshot_observed_at":"2026-08-08T22:51:11.447471Z","submitted_at":"2025-07-14T13:51:28Z","title":"Prompt Informed Reinforcement Learning for Visual Coverage Path Planning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:39:45.103900Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2507.10284"},"observation_digest":"sha256:9414eee4808fa4aaff0588865ef90009afc621b36220cac5b1a6472ae2ce510e","observation_id":"add81e89-0e28-4c1e-b6a8-8551fdc962c9","resolution":{"observed_at":"2026-08-06T17:39:45.103900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-06T17:12:28.663704Z","title":"M., Bullard, K., and Sadigh, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12496","last_updated":"2025-07-15T21:49:49Z","snapshot_observed_at":"2026-08-06T17:00:15.350427Z","submitted_at":"2025-07-15T21:49:49Z","title":"FOUNDER: Grounding Foundation Models in World Models for Open-Ended Embodied Decision Making","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T17:12:28.663704Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2507.12496"},"observation_digest":"sha256:c0c2c421c506aa4bfbe83e010049180817636b6d2e3b24f1124c49819eee6dda","observation_id":"1c00c216-2a6c-4e00-bfd4-e78c84b992a8","resolution":{"observed_at":"2026-08-06T17:12:28.663704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-06T15:40:15.257918Z","title":"Reward design with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15906","last_updated":"2025-07-21T12:51:29Z","snapshot_observed_at":"2026-08-08T08:50:14.371298Z","submitted_at":"2025-07-21T12:51:29Z","title":"Towards Reliable, Uncertainty-Aware Alignment","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T15:40:15.257918Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2507.15906"},"observation_digest":"sha256:62a1c8189e1702799c8f59cf5ef9d9440057acaaf7d51a1856f7044dfd82c107","observation_id":"33e0d3f5-5f7a-4d3d-a8d7-a3ec2544814f","resolution":{"observed_at":"2026-08-06T15:40:15.257918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-06T12:30:39.980782Z","title":"Reward design with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.21696","last_updated":"2025-08-27T09:28:59Z","snapshot_observed_at":"2026-08-08T00:28:50.797008Z","submitted_at":"2025-07-29T11:20:03Z","title":"Edge Agentic AI Framework for Autonomous Network Optimisation in O-RAN","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T12:30:39.980782Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2507.21696"},"observation_digest":"sha256:d0748b6141549ac521546aa6cc1fce0241ffb54e13b80c69736865b73e185f29","observation_id":"158fe600-ef6b-423d-b6c2-3bc5a8a134f2","resolution":{"observed_at":"2026-08-06T12:30:39.980782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-05T17:36:53.242484Z","title":"Reward design with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16090","last_updated":"2025-08-22T05:02:50Z","snapshot_observed_at":"2026-08-09T17:33:47.652370Z","submitted_at":"2025-08-22T05:02:50Z","title":"GPLight+: A Genetic Programming Method for Learning Symmetric Traffic Signal Control Policy","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:36:53.242484Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2508.16090"},"observation_digest":"sha256:93d0234ca17debf6f184960280b2f560423a757d0a9771f412f8317ee4eed681","observation_id":"f305a4a6-4972-4115-b611-ad80f1e9c0ef","resolution":{"observed_at":"2026-08-05T17:36:53.242484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-05T16:21:00.388060Z","title":"Reward design with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18725","last_updated":"2025-08-26T06:50:11Z","snapshot_observed_at":"2026-08-06T22:55:46.437867Z","submitted_at":"2025-08-26T06:50:11Z","title":"Toward Edge General Intelligence with Agentic AI and Agentification: Concepts, Technologies, and Future Directions","version":1},"reference_index":232,"source":"pdf_text","source_observed_at":"2026-08-05T16:21:00.388060Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2508.18725"},"observation_digest":"sha256:b6ad00fb27bee1791c1e7e0f1ec6d444e793b4560162ab7c15dbc4138d851727","observation_id":"68ebd632-382e-45fe-8ad4-a5484af427e8","resolution":{"observed_at":"2026-08-05T16:21:00.388060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-05T14:20:39.757357Z","title":"Reward design with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21378","last_updated":"2026-07-21T12:16:52Z","snapshot_observed_at":"2026-08-05T14:20:35.593238Z","submitted_at":"2025-08-29T07:47:17Z","title":"RoboInspector: Unveiling the Unreliability of Policy Code for LLM-enabled Robotic Manipulation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:20:39.757357Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2508.21378"},"observation_digest":"sha256:81e6ce4ce1b7a9fd71bec5ca75ac940a490464fdb623b71e2d0a9a49f7c560f3","observation_id":"0d87d1aa-846d-47c2-8241-a9f836e426a5","resolution":{"observed_at":"2026-08-05T14:20:39.757357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-04T16:06:58.488030Z","title":"Reward design with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.16136","last_updated":"2026-06-06T20:56:22Z","snapshot_observed_at":"2026-08-06T11:44:23.885368Z","submitted_at":"2025-09-19T16:35:27Z","title":"Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:58.488030Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2509.16136"},"observation_digest":"sha256:6fcc9b0c469406ca9a451c08e20358e528641e200cfebd36b348d7ab5504fe0f","observation_id":"53f15e63-da33-4bec-97ac-afdc54c976d8","resolution":{"observed_at":"2026-08-04T16:06:58.488030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2509.16615","last_updated":"2026-04-14T09:38:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-20T10:37:47Z","title":"LLM-Guided Task- and Affordance-Level Exploration in Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T15:19:30.609974Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2509.16615"},"observation_digest":"sha256:fc894a1c90f1ba4c9761227536772029e79c298f2a4380d978b02eb70b19d171","observation_id":"8d415c79-628b-4620-92da-edc874336346","resolution":{"observed_at":"2026-05-18T15:21:32.889019Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-04T10:37:26.093669Z","title":"Reward design with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10028","last_updated":"2026-06-07T08:26:55Z","snapshot_observed_at":"2026-08-08T19:36:11.880777Z","submitted_at":"2025-10-11T05:11:21Z","title":"Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T10:37:26.093669Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2510.10028"},"observation_digest":"sha256:46228515d444d1639512cdc305c60d8fb509c38ee92987474c75120634d40faf","observation_id":"0c805b36-670c-40b6-a7f6-f052dc25baf7","resolution":{"observed_at":"2026-08-04T10:37:26.093669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-04T09:22:42.928860Z","title":"Reward design with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.15859","last_updated":"2026-05-29T10:51:31Z","snapshot_observed_at":"2026-08-08T07:58:01.573052Z","submitted_at":"2025-10-17T17:51:28Z","title":"InfiMed-ORBIT: Aligning LLMs on Open-Ended Complex Tasks via Rubric-Based Incremental Training","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T09:22:42.928860Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2510.15859"},"observation_digest":"sha256:22c3810f9abac32bf87f2643941e071423778bc607fe81943341b0ad128da07e","observation_id":"587ece49-1ab1-4654-ac28-0f2667bb4dd4","resolution":{"observed_at":"2026-08-04T09:22:42.928860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-04T07:27:03.942685Z","title":"Reward design with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.25850","last_updated":"2026-06-23T00:18:36Z","snapshot_observed_at":"2026-08-07T08:02:35.986513Z","submitted_at":"2025-10-29T18:00:16Z","title":"Debate2Create: Robot Co-design via Multi-Agent LLM Debate","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T07:27:03.942685Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2510.25850"},"observation_digest":"sha256:66bfdc88af2af201e3032b8f7a858e81b9474de1c34f2c1ed56a11716ec5196c","observation_id":"e7182a7d-daf9-4bc4-82b3-89d1677e696b","resolution":{"observed_at":"2026-08-04T07:27:03.942685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2512.00778","last_updated":"2026-05-15T09:26:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-30T08:27:59Z","title":"What Is Preference Optimization Doing, and Why?","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T18:37:48.161545Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2512.00778"},"observation_digest":"sha256:fc46bf403c59a59303b977a563a8ae8f9caae5d1d28ddb1a7ed6232931c479bc","observation_id":"ebcf14d4-251c-4889-8f75-1e163c19b504","resolution":{"observed_at":"2026-05-21T18:40:28.991254Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2604.10517","last_updated":"2026-04-12T08:14:49Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T08:14:49Z","title":"From Perception to Planning: Evolving Ego-Centric Task-Oriented Spatiotemporal Reasoning via Curriculum Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T16:35:36.083682Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2604.10517"},"observation_digest":"sha256:f7383a6c66e4b2b07dfeaa863b81cb9ad880f01bff58e5f2978cae02f61fba1a","observation_id":"dffd4cd3-bcf8-45cd-b02b-63d131037c6a","resolution":{"observed_at":"2026-05-11T08:30:58.248439Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2605.01123","last_updated":"2026-05-01T21:49:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-01T21:49:20Z","title":"PERSA: Reinforcement Learning for Professor-Style Personalized Feedback with LLMs","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-09T19:09:07.557773Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2605.01123"},"observation_digest":"sha256:fcba8193bba21563ddef208be622894c7d1ba15782bf28b16dd92f34430bbee5","observation_id":"e2cb6821-a8dc-49f6-adeb-643f1b2a32b6","resolution":{"observed_at":"2026-05-11T15:51:42.642392Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2605.02073","last_updated":"2026-05-08T17:11:09Z","snapshot_observed_at":"2026-08-02T23:23:17.487808Z","submitted_at":"2026-05-03T22:01:25Z","title":"Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T19:14:22.162163Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2605.02073"},"observation_digest":"sha256:23b70f7c0ebc6cf0c54397dd81e1ce995d61eeb655af44b50df0a925d25bdcdb","observation_id":"95fafb7d-3014-4d2b-b6dc-572abe964758","resolution":{"observed_at":"2026-05-09T06:00:35.202959Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2605.02073","last_updated":"2026-05-08T17:11:09Z","snapshot_observed_at":"2026-08-02T23:23:17.487808Z","submitted_at":"2026-05-03T22:01:25Z","title":"Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T02:10:46.725354Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2605.02073"},"observation_digest":"sha256:42a641990df3901abf52313553907c8898cf95ca7fe93b5a0180749f25bacfa2","observation_id":"dfbba3b9-0fd3-4fa0-86ff-dd484a6ff85b","resolution":{"observed_at":"2026-05-11T03:50:58.007955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2605.08315","last_updated":"2026-05-08T14:26:40Z","snapshot_observed_at":"2026-07-31T18:56:01.160228Z","submitted_at":"2026-05-08T14:26:40Z","title":"Reflective Prompted Policy Optimization: Trajectory-Grounded Revision and Salience Bias","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T00:51:58.315109Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2605.08315"},"observation_digest":"sha256:b1ea99629f26bcdf85a092f98a29983a99391a0cf6b6050dd27c28a611050983","observation_id":"a11363b3-61f5-44ea-97ff-02d463e3429f","resolution":{"observed_at":"2026-05-12T08:41:24.007336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2605.11859","last_updated":"2026-05-12T09:43:21Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:43:21Z","title":"EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T05:19:38.587352Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2605.11859"},"observation_digest":"sha256:610cac471ec5bcc1205dfd377b55c08de490d09acb7b931516d7b13fae38cbf7","observation_id":"5ee0afc7-d13a-45fd-8fc6-79051e300cb8","resolution":{"observed_at":"2026-05-13T05:27:18.924884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2605.17900","last_updated":"2026-05-18T06:06:01Z","snapshot_observed_at":"2026-08-02T23:40:34.130341Z","submitted_at":"2026-05-18T06:06:01Z","title":"DuIVRS-2: An LLM-based Interactive Voice Response System for Large-scale POI Attribute Acquisition","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-20T10:30:48.957568Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2605.17900"},"observation_digest":"sha256:6e4783d9321f7c65beb5fe1c343f4dda81c99908c2db2ef457bfd4d1a1a93bb1","observation_id":"1a53cd80-346a-4d58-93e6-720fad5239bf","resolution":{"observed_at":"2026-05-20T10:33:12.905500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2606.06673","last_updated":"2026-06-04T19:46:45Z","snapshot_observed_at":"2026-08-04T00:52:00.771854Z","submitted_at":"2026-06-04T19:46:45Z","title":"Uncertainty-Aware LLM-Guided Policy Shaping for Sparse-Reward Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T02:47:16.737433Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2606.06673"},"observation_digest":"sha256:21d51bd7b79d126da402c8d8fc9a0f680243e012d3e5566725dfe8e22da8caa5","observation_id":"19b9b349-5bd5-431a-80e2-fc59e6710367","resolution":{"observed_at":"2026-07-02T11:56:55.227147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2606.10528","last_updated":"2026-06-09T07:57:50Z","snapshot_observed_at":"2026-07-06T23:49:41.940954Z","submitted_at":"2026-06-09T07:57:50Z","title":"Representation-Aware Advantage Estimation: Your Reward Model Provides More Than A Scalar Output","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T13:39:17.701196Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2606.10528"},"observation_digest":"sha256:2a5c4b1fab7d7923274f614225596e2a480a3b93583aeb2ee51f689cf7b09557","observation_id":"c880b2a2-7d08-4386-8ba3-647b6b3461c4","resolution":{"observed_at":"2026-07-03T04:47:38.288260Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":"2303.00001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-07-03T04:47:38.286725Z","title":"Reward design with language models","venue":null,"work_id":"e0ce7714-ca83-4606-96d1-cc5e046c1ff9","year":2023},"citing_paper":{"arxiv_id":"2606.29869","last_updated":"2026-06-29T07:05:56Z","snapshot_observed_at":"2026-08-02T12:22:24.399410Z","submitted_at":"2026-06-29T07:05:56Z","title":"ARKD: Adaptive Reinforcement Learning-Guided Bidirectional KL Divergence Distillation for Text Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-30T05:59:13.483829Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2606.29869"},"observation_digest":"sha256:f9ebb23058879cbbf8510de17a0b4eab9f75ad23837e51a31a5e8255db462810","observation_id":"e6ae1a8e-4136-4dfc-aa6e-dccf1d2d497b","resolution":{"observed_at":"2026-06-30T06:04:21.642435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-01T18:24:05.608019Z","title":"Reward design with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.17317","last_updated":"2026-07-19T16:01:11Z","snapshot_observed_at":"2026-08-07T23:16:24.147023Z","submitted_at":"2026-07-19T16:01:11Z","title":"TAPAS: Throughput-adaptive Perception for Autonomous Systems","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T18:24:05.608019Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2607.17317"},"observation_digest":"sha256:da5aada8ddf406066209df48f2dba85dccf76dcc48e12f54af6c4b4eb0e06416","observation_id":"29c5a56c-d257-4a05-9423-3de842757ff7","resolution":{"observed_at":"2026-08-01T18:24:05.608019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-01T15:27:06.396909Z","title":"arXiv preprint arXiv:2303.00001 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18443","last_updated":"2026-07-20T18:51:46Z","snapshot_observed_at":"2026-08-07T21:48:17.505747Z","submitted_at":"2026-07-20T18:51:46Z","title":"Computational models of pragmatic reasoning with flexible generation of meaning and expression alternatives","version":1},"reference_index":150,"source":"arxiv_source","source_observed_at":"2026-08-01T15:27:06.396909Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2607.18443"},"observation_digest":"sha256:02754988a6c5a179b03bf89513b5f619eefbb99e37a5af02b4fdeda42ee8071c","observation_id":"913bc2cf-6378-4779-8888-177241f91b5a","resolution":{"observed_at":"2026-08-01T15:27:06.396909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2303.00001/citation-record","integrity":"/paper/2303.00001/integrity","json":"/paper/2303.00001/citation-record.json","paper":"/paper/2303.00001"},"outbound":[],"paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T18:19:01.490243Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2303.00001."}