{"as_of":"2026-08-11T07:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:28b33077f07f757f02c1251adb1640e68cf8c9434f97a2bce728a16f0d8ed39a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T06:05:40.300660Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-07T12:53:50.316535Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-13T08:57:22.299028Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2307.05973"},"observation_digest":"sha256:0c9f8bd38279e54ebe00491359fbbd2c3a3184b6c0b290c8a4f804d2280dc3aa","observation_id":"8740558b-4808-4940-86a3-12562da04c3f","resolution":{"observed_at":"2026-05-13T08:57:22.356658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-11T06:05:40.300660Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16878","last_updated":"2024-12-22T06:15:25Z","snapshot_observed_at":"2026-08-11T05:59:06.290245Z","submitted_at":"2024-12-22T06:15:25Z","title":"Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:40.300660Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2412.16878"},"observation_digest":"sha256:a679b2bbcfbe2117e51b969e3aa396d1b9a6710aed18b8a07c8489f260bfb179","observation_id":"82af9108-2ebc-431b-bdc9-1323de5f9e57","resolution":{"observed_at":"2026-08-11T06:05:40.300660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-08T00:03:16.500490Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08643","last_updated":"2025-02-18T16:45:59Z","snapshot_observed_at":"2026-08-09T11:31:44.840528Z","submitted_at":"2025-02-12T18:57:22Z","title":"A Real-to-Sim-to-Real Approach to Robotic Manipulation with VLM-Generated Iterative Keypoint Rewards","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T00:03:16.500490Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2502.08643"},"observation_digest":"sha256:74a7f63113961c582aa8e683c483b1cd18bfbe1568830cc8aedb51d4df246dde","observation_id":"a102b346-d097-4ca6-aa9d-2dbaf6820c14","resolution":{"observed_at":"2026-08-08T00:03:16.500490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2504.01990","last_updated":"2025-08-02T12:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T18:00:29Z","title":"Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems","version":2},"reference_index":133,"source":"pdf_text","source_observed_at":"2026-05-22T21:39:49.832151Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2504.01990"},"observation_digest":"sha256:0b845ce08530755b2a26a85d64ecca7b55389e0ed83b5c7904290871892fbb48","observation_id":"174f6f66-0c2a-45e2-9233-ca45e25201a4","resolution":{"observed_at":"2026-05-22T21:42:10.816989Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-07T15:13:43.841984Z","title":"Text2reward: Reward shaping with language models for reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15793","last_updated":"2025-05-22T04:48:12Z","snapshot_observed_at":"2026-08-09T06:40:36.946957Z","submitted_at":"2025-05-21T17:47:24Z","title":"HCRMP: A LLM-Hinted Contextual Reinforcement Learning Framework for Autonomous Driving","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:13:43.841984Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2505.15793"},"observation_digest":"sha256:741dfc6bbfa73b73bf3c2d0fe9e4256352ab027e55db2fed1895fe9119223184","observation_id":"869f221a-4444-4f51-bd69-bb2e6a21cab0","resolution":{"observed_at":"2026-08-07T15:13:43.841984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-07T14:25:26.188530Z","title":"Text2reward: Reward shaping with language models for reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19196","last_updated":"2025-05-25T15:43:54Z","snapshot_observed_at":"2026-08-10T09:23:16.914352Z","submitted_at":"2025-05-25T15:43:54Z","title":"Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:26.188530Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2505.19196"},"observation_digest":"sha256:8790a0e225dbd93f09e6078301c053ce28c39a553ed85969d3ea0a416730d722","observation_id":"d0a81003-26d7-43ce-ba62-ae59e4f1d1e5","resolution":{"observed_at":"2026-08-07T14:25:26.188530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-04T22:16:14.289687Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.07445","last_updated":"2025-09-09T07:10:39Z","snapshot_observed_at":"2026-08-08T16:18:53.310007Z","submitted_at":"2025-09-09T07:10:39Z","title":"Text2Touch: Tactile In-Hand Manipulation with LLM-Designed Reward Functions","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T22:16:14.289687Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2509.07445"},"observation_digest":"sha256:b1b5b5a723a0ff7525fb86e8f1f5ba45a76e7f2afb30ea340bed4f70401d6bff","observation_id":"7a4f9053-a688-482a-ae85-e31501427ad3","resolution":{"observed_at":"2026-08-04T22:16:14.289687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-04T16:06:57.016648Z","title":"Text2reward: Reward shaping with language models for reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.16136","last_updated":"2026-06-06T20:56:22Z","snapshot_observed_at":"2026-08-10T20:19:51.572441Z","submitted_at":"2025-09-19T16:35:27Z","title":"Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T16:06:57.016648Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2509.16136"},"observation_digest":"sha256:ba844ccc62ee7d5abcf04b6029474c5a184d7a66772e01d2fbfbe71f7e97545b","observation_id":"faf0f930-f3c5-4630-a678-b54619866c89","resolution":{"observed_at":"2026-08-04T16:06:57.016648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2509.16615","last_updated":"2026-04-14T09:38:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-20T10:37:47Z","title":"LLM-Guided Task- and Affordance-Level Exploration in Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T15:19:30.609974Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2509.16615"},"observation_digest":"sha256:46bdcbe3623885d2d5193b9ec71e3b557fd7a3d08225be3fcec5919810227421","observation_id":"9f5e5edb-2f76-47dd-ab22-4e6287629dcd","resolution":{"observed_at":"2026-05-18T15:21:32.862328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-04T10:37:26.211102Z","title":"Text2reward: Reward shaping with language models for reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.10028","last_updated":"2026-06-07T08:26:55Z","snapshot_observed_at":"2026-08-11T04:55:33.433809Z","submitted_at":"2025-10-11T05:11:21Z","title":"Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T10:37:26.211102Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2510.10028"},"observation_digest":"sha256:d59fe0070d5a1c151296a5ce893d566f07ec3464b179cdc47adc58897eff231f","observation_id":"5fcb6402-7388-4175-8738-e944f9b01c1b","resolution":{"observed_at":"2026-08-04T10:37:26.211102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-04T07:23:07.784752Z","title":"Text2reward: Reward shaping with language models for reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.26113","last_updated":"2026-06-18T20:06:47Z","snapshot_observed_at":"2026-08-06T20:27:36.141566Z","submitted_at":"2025-10-30T03:53:22Z","title":"EgoExo-Con: Exploring View-Invariant Video Temporal Understanding","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T07:23:07.784752Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2510.26113"},"observation_digest":"sha256:0f9ed9ff28fa0d9ff3980cc41746472f5a6251dfa18651e2399978c045e1f2f7","observation_id":"7b3121aa-73da-422d-9565-dc6e6dfe64e0","resolution":{"observed_at":"2026-08-04T07:23:07.784752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2603.12145","last_updated":"2026-05-17T22:47:12Z","snapshot_observed_at":"2026-07-06T22:48:53.198077Z","submitted_at":"2026-03-12T16:45:47Z","title":"Automatic Generation of High-Performance RL Environments","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-21T11:04:11.718672Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2603.12145"},"observation_digest":"sha256:f48810e82d11dc7839c8b928b82a831641cf9251be6d20a792a49d8f0f30ca2d","observation_id":"5eddd61c-4bec-4df1-a17e-c6b1746cd718","resolution":{"observed_at":"2026-05-21T11:05:01.520674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2604.19773","last_updated":"2026-03-27T12:13:20Z","snapshot_observed_at":"2026-08-03T12:53:29.360699Z","submitted_at":"2026-03-27T12:13:20Z","title":"PR-CAD: Progressive Refinement for Unified Controllable and Faithful Text-to-CAD Generation with Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T23:17:29.025222Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2604.19773"},"observation_digest":"sha256:98d940ecd6bb21f4ab5311eb4c18d23f925d03b6d54bce2cbde0c93755117f41","observation_id":"8caf378a-ab71-4dc1-b7e9-0f224c756884","resolution":{"observed_at":"2026-05-14T23:18:15.758972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2605.02073","last_updated":"2026-05-08T17:11:09Z","snapshot_observed_at":"2026-08-02T23:23:17.487808Z","submitted_at":"2026-05-03T22:01:25Z","title":"Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T19:14:22.162163Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2605.02073"},"observation_digest":"sha256:797e47431dccf0832eebef0f0027eddd29c696f5440a8c986bbe432a8ba8724e","observation_id":"38e963a9-50ad-4d1c-95f0-f9b0c1c28d83","resolution":{"observed_at":"2026-05-09T06:00:35.206079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2605.02073","last_updated":"2026-05-08T17:11:09Z","snapshot_observed_at":"2026-08-02T23:23:17.487808Z","submitted_at":"2026-05-03T22:01:25Z","title":"Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T02:10:46.725354Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2605.02073"},"observation_digest":"sha256:61b2cbc560569f30a3b571fb754768088403483ba65e688e2ff0fa51ada83e4e","observation_id":"72f94d4b-0117-4a26-8472-e567430873dd","resolution":{"observed_at":"2026-05-11T03:50:57.895007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2605.09423","last_updated":"2026-05-13T08:34:40Z","snapshot_observed_at":"2026-07-31T05:53:49.791813Z","submitted_at":"2026-05-10T08:51:50Z","title":"SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-12T04:21:44.087943Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2605.09423"},"observation_digest":"sha256:54af787c5abcb8a66c95f7d5688aa246cbab18bc60aef348c6157516a2fb42e1","observation_id":"c1a87110-1785-4874-bae1-e61994a20dc9","resolution":{"observed_at":"2026-05-12T06:21:26.415726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2605.09423","last_updated":"2026-05-13T08:34:40Z","snapshot_observed_at":"2026-07-31T05:53:49.791813Z","submitted_at":"2026-05-10T08:51:50Z","title":"SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-14T21:30:42.766390Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2605.09423"},"observation_digest":"sha256:dfc50a1aad1b7382e06d2ff8f29befae8695f444bce4fe6b68309a94ceaa5247","observation_id":"e8e8a514-64ad-41ec-9936-201378a99ba2","resolution":{"observed_at":"2026-05-14T21:32:59.551200Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2605.11859","last_updated":"2026-05-12T09:43:21Z","snapshot_observed_at":"2026-07-06T23:23:39.723268Z","submitted_at":"2026-05-12T09:43:21Z","title":"EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T05:19:38.587352Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2605.11859"},"observation_digest":"sha256:7c9c8aef4fae6e2975c61497a15e1e1831333b3978d1b61fbd83eecc7b545f4a","observation_id":"8dbef211-ee88-4f67-8fe5-8d0785d58fdb","resolution":{"observed_at":"2026-05-13T05:27:18.909313Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2606.00083","last_updated":"2026-05-22T16:04:22Z","snapshot_observed_at":"2026-08-02T22:15:21.959965Z","submitted_at":"2026-05-22T16:04:22Z","title":"From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T15:25:14.906470Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2606.00083"},"observation_digest":"sha256:03b00de8bc169992ade3d505bb3f052c25cab2636a694f0b8a068474178fcf81","observation_id":"42126c6e-4e3a-4f13-a566-4228b2b66bac","resolution":{"observed_at":"2026-06-30T15:34:48.377018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2606.17362","last_updated":"2026-06-15T23:39:36Z","snapshot_observed_at":"2026-08-06T06:37:52.220532Z","submitted_at":"2026-06-15T23:39:36Z","title":"DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-27T03:04:13.554098Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2606.17362"},"observation_digest":"sha256:5a115c618ddc460f88a0899a9f4420ef4cd6021e0fb94330bf58dd69a2f847fb","observation_id":"88e32e35-6223-45a4-a682-cb088f22245a","resolution":{"observed_at":"2026-07-03T18:28:48.875284Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":235,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:e8623ddae0f53d0d9d07df1b139249df29c7a26f4fec7a02a689caccee062fbd","observation_id":"6289b284-d96d-4818-964e-f2504f346da8","resolution":{"observed_at":"2026-07-04T08:09:40.538848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2309.11489","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-07T12:53:50.316535Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning","venue":"cs.LG","work_id":"936973da-fa6b-4e55-a9af-d909a7c0810f","year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-07T12:47:29.552283Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:754c8059dbc8c0a53b2f4788da3add5e177df71595ff66eefa28b64ab518b7d2","observation_id":"19b326fd-8551-41a7-91eb-26efa587dcb4","resolution":{"observed_at":"2026-07-07T12:53:50.318343Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-07-11T07:02:51.850836Z","title":"Text2Reward: Reward shaping with language models for reinforcement learning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05391","last_updated":"2026-07-07T17:26:37Z","snapshot_observed_at":"2026-08-06T03:00:58.001418Z","submitted_at":"2026-07-06T17:59:35Z","title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-11T07:02:51.850836Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2607.05391"},"observation_digest":"sha256:3c416a0d9cf8be358b8eb4960423911a61f1fb84ab92a2fe60afa1120a3f59a4","observation_id":"452ca998-7168-4afb-8c1e-428707d1d97f","resolution":{"observed_at":"2026-07-11T07:02:51.850836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-01T03:14:12.941468Z","title":"arXiv:2309.11489","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-10T17:59:42.036461Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:12.941468Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:ac6c2b520cc8960408adbe9c7b53fc58830dfc815485d184335c2679a5fbf97c","observation_id":"78f09d93-52dd-4add-9bea-8dfd62e6d254","resolution":{"observed_at":"2026-08-01T03:14:12.941468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-04T19:45:35.370242Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01851","last_updated":"2026-08-03T07:58:35Z","snapshot_observed_at":"2026-08-07T23:22:57.641630Z","submitted_at":"2026-08-03T07:58:35Z","title":"Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills","version":1},"reference_index":280,"source":"pdf_text","source_observed_at":"2026-08-04T19:45:35.370242Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2608.01851"},"observation_digest":"sha256:9cb68aafac6c6c1c4f0a564912a9bf7a3b6e0786f8c7894628c5a5f5be3437d7","observation_id":"f020b07f-da1a-4fd7-9999-e83625f0a3d3","resolution":{"observed_at":"2026-08-04T19:45:35.370242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11489","snapshot_observed_at":"2026-08-10T14:00:57.575235Z","title":"Text2reward: Reward shaping with language models for reinforcement learning.arXiv preprint arXiv:2309.11489,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07148","last_updated":"2026-08-07T12:10:08Z","snapshot_observed_at":"2026-08-11T07:13:17.622979Z","submitted_at":"2026-08-07T12:10:08Z","title":"A MARL Centered Reference Architecture for Large Language Model Augmentation in Smart Manufacturing","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T14:00:57.575235Z"},"links":{"cited_paper":"/paper/2309.11489","citing_paper":"/paper/2608.07148"},"observation_digest":"sha256:f613444687e0a38d93b79d3850a9e0490ef122231c550e7b797c8f2fb9e39dff","observation_id":"3adadb00-0a3a-4261-834e-9934c7b85214","resolution":{"observed_at":"2026-08-10T14:00:57.575235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2309.11489/citation-record","integrity":"/paper/2309.11489/integrity","json":"/paper/2309.11489/citation-record.json","paper":"/paper/2309.11489"},"outbound":[],"paper":{"arxiv_id":"2309.11489","last_updated":"2024-05-25T06:42:10Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T20:26:56.795511Z","submitted_at":"2023-09-20T17:39:13Z","title":"Text2Reward: Reward Shaping with Language Models for Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2309.11489."}