Pith. sign in

Paper Citation Record · LEDGER

Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2309.11489.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2309.11489 v3

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 26 of 26 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-11T06:34:44.6726+00:00

measured 26 of 26 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-11T06:05:40.300660Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-07T12:53:50.316535Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 8740558b-4808-4940-86a3-12562da04c3f · inbound

VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models cites this paper.

VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 85

Resolution
verified exact
arxiv_id, observed 2026-05-13T08:57:22.356658Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-13T08:57:22.299028Z digest=sha256:0c9f8bd38279e54ebe00491359fbbd2c3a3184b6c0b290c8a4f804d2280dc3aa

Observation 82af9108-2ebc-431b-bdc9-1323de5f9e57 · inbound

Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model cites this paper.

Online Preference-based Reinforcement Learning with Self-augmented Feedback from Large Language Model Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-11T06:05:40.300660Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-11T06:05:40.300660Z digest=sha256:a679b2bbcfbe2117e51b969e3aa396d1b9a6710aed18b8a07c8489f260bfb179

Observation a102b346-d097-4ca6-aa9d-2dbaf6820c14 · inbound

A Real-to-Sim-to-Real Approach to Robotic Manipulation with VLM-Generated Iterative Keypoint Rewards cites this paper.

A Real-to-Sim-to-Real Approach to Robotic Manipulation with VLM-Generated Iterative Keypoint Rewards Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-08T00:03:16.500490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T00:03:16.500490Z digest=sha256:74a7f63113961c582aa8e683c483b1cd18bfbe1568830cc8aedb51d4df246dde

Observation 174f6f66-0c2a-45e2-9233-ca45e25201a4 · inbound

Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems cites this paper.

Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 133

Resolution
verified exact
arxiv_id, observed 2026-05-22T21:42:10.816989Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-22T21:39:49.832151Z digest=sha256:0b845ce08530755b2a26a85d64ecca7b55389e0ed83b5c7904290871892fbb48

Observation 869f221a-4444-4f51-bd69-bb2e6a21cab0 · inbound

HCRMP: A LLM-Hinted Contextual Reinforcement Learning Framework for Autonomous Driving cites this paper.

HCRMP: A LLM-Hinted Contextual Reinforcement Learning Framework for Autonomous Driving Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T15:13:43.841984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:13:43.841984Z digest=sha256:741dfc6bbfa73b73bf3c2d0fe9e4256352ab027e55db2fed1895fe9119223184

Observation d0a81003-26d7-43ce-ba62-ae59e4f1d1e5 · inbound

Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning cites this paper.

Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T14:25:26.188530Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:25:26.188530Z digest=sha256:8790a0e225dbd93f09e6078301c053ce28c39a553ed85969d3ea0a416730d722

Observation 7a4f9053-a688-482a-ae85-e31501427ad3 · inbound

Text2Touch: Tactile In-Hand Manipulation with LLM-Designed Reward Functions cites this paper.

Text2Touch: Tactile In-Hand Manipulation with LLM-Designed Reward Functions Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-04T22:16:14.289687Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T22:16:14.289687Z digest=sha256:b1b5b5a723a0ff7525fb86e8f1f5ba45a76e7f2afb30ea340bed4f70401d6bff

Observation faf0f930-f3c5-4630-a678-b54619866c89 · inbound

Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning cites this paper.

Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-04T16:06:57.016648Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T16:06:57.016648Z digest=sha256:ba844ccc62ee7d5abcf04b6029474c5a184d7a66772e01d2fbfbe71f7e97545b

Observation 9f5e5edb-2f76-47dd-ab22-4e6287629dcd · inbound

LLM-Guided Task- and Affordance-Level Exploration in Reinforcement Learning cites this paper.

LLM-Guided Task- and Affordance-Level Exploration in Reinforcement Learning Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:21:32.862328Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-18T15:19:30.609974Z digest=sha256:46bdcbe3623885d2d5193b9ec71e3b557fd7a3d08225be3fcec5919810227421

Observation 5fcb6402-7388-4175-8738-e944f9b01c1b · inbound

Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization cites this paper.

Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-04T10:37:26.211102Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T10:37:26.211102Z digest=sha256:d59fe0070d5a1c151296a5ce893d566f07ec3464b179cdc47adc58897eff231f

Observation 7b3121aa-73da-422d-9565-dc6e6dfe64e0 · inbound

EgoExo-Con: Exploring View-Invariant Video Temporal Understanding cites this paper.

EgoExo-Con: Exploring View-Invariant Video Temporal Understanding Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-04T07:23:07.784752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T07:23:07.784752Z digest=sha256:0f9ed9ff28fa0d9ff3980cc41746472f5a6251dfa18651e2399978c045e1f2f7

Observation 5eddd61c-4bec-4df1-a17e-c6b1746cd718 · inbound

Automatic Generation of High-Performance RL Environments cites this paper.

Automatic Generation of High-Performance RL Environments Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-05-21T11:05:01.520674Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-21T11:04:11.718672Z digest=sha256:f48810e82d11dc7839c8b928b82a831641cf9251be6d20a792a49d8f0f30ca2d

Observation 8caf378a-ab71-4dc1-b7e9-0f224c756884 · inbound

PR-CAD: Progressive Refinement for Unified Controllable and Faithful Text-to-CAD Generation with Large Language Models cites this paper.

PR-CAD: Progressive Refinement for Unified Controllable and Faithful Text-to-CAD Generation with Large Language Models Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-14T23:18:15.758972Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-14T23:17:29.025222Z digest=sha256:98d940ecd6bb21f4ab5311eb4c18d23f925d03b6d54bce2cbde0c93755117f41

Observation 38e963a9-50ad-4d1c-95f0-f9b0c1c28d83 · inbound

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning cites this paper.

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-09T06:00:35.206079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-08T19:14:22.162163Z digest=sha256:797e47431dccf0832eebef0f0027eddd29c696f5440a8c986bbe432a8ba8724e

Observation 72f94d4b-0117-4a26-8472-e567430873dd · inbound

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning cites this paper.

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-11T03:50:57.895007Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-11T02:10:46.725354Z digest=sha256:61b2cbc560569f30a3b571fb754768088403483ba65e688e2ff0fa51ada83e4e

Observation c1a87110-1785-4874-bae1-e61994a20dc9 · inbound

SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning cites this paper.

SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 91

Resolution
verified exact
arxiv_id, observed 2026-05-12T06:21:26.415726Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-12T04:21:44.087943Z digest=sha256:54af787c5abcb8a66c95f7d5688aa246cbab18bc60aef348c6157516a2fb42e1

Observation e8e8a514-64ad-41ec-9936-201378a99ba2 · inbound

SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning cites this paper.

SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 91

Resolution
verified exact
arxiv_id, observed 2026-05-14T21:32:59.551200Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-14T21:30:42.766390Z digest=sha256:dfc50a1aad1b7382e06d2ff8f29befae8695f444bce4fe6b68309a94ceaa5247

Observation 8dbef211-ee88-4f67-8fe5-8d0785d58fdb · inbound

EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models cites this paper.

EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 45

Resolution
verified exact
arxiv_id, observed 2026-05-13T05:27:18.909313Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-05-13T05:19:38.587352Z digest=sha256:7c9c8aef4fae6e2975c61497a15e1e1831333b3978d1b61fbd83eecc7b545f4a

Observation 42126c6e-4e3a-4f13-a566-4228b2b66bac · inbound

From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models cites this paper.

From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-06-30T15:34:48.377018Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-06-30T15:25:14.906470Z digest=sha256:03b00de8bc169992ade3d505bb3f052c25cab2636a694f0b8a068474178fcf81

Observation 88e32e35-6223-45a4-a682-cb088f22245a · inbound

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models cites this paper.

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 49

Resolution
verified exact
arxiv_id, observed 2026-07-03T18:28:48.875284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-06-27T03:04:13.554098Z digest=sha256:5a115c618ddc460f88a0899a9f4420ef4cd6021e0fb94330bf58dd69a2f847fb

Observation 6289b284-d96d-4818-964e-f2504f346da8 · inbound

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning cites this paper.

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 235

Resolution
verified exact
arxiv_id, observed 2026-07-04T08:09:40.538848Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-06-26T12:15:08.304150Z digest=sha256:e8623ddae0f53d0d9d07df1b139249df29c7a26f4fec7a02a689caccee062fbd

Observation 19b326fd-8551-41a7-91eb-26efa587dcb4 · inbound

LLM-as-a-Verifier: A General-Purpose Verification Framework cites this paper.

LLM-as-a-Verifier: A General-Purpose Verification Framework Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 82

Resolution
verified exact
local_arxiv, observed 2026-07-07T12:53:50.318343Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-07-07T12:47:29.552283Z digest=sha256:754c8059dbc8c0a53b2f4788da3add5e177df71595ff66eefa28b64ab518b7d2

Observation 452ca998-7168-4afb-8c1e-428707d1d97f · inbound

LLM-as-a-Verifier: A General-Purpose Verification Framework cites this paper.

LLM-as-a-Verifier: A General-Purpose Verification Framework Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 82

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:3c416a0d9cf8be358b8eb4960423911a61f1fb84ab92a2fe60afa1120a3f59a4

Observation 78f09d93-52dd-4add-9bea-8dfd62e6d254 · inbound

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback cites this paper.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:12.941468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:12.941468Z digest=sha256:ac6c2b520cc8960408adbe9c7b53fc58830dfc815485d184335c2679a5fbf97c

Observation f020b07f-da1a-4fd7-9999-e83625f0a3d3 · inbound

Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills cites this paper.

Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 280

Resolution
unresolved
no resolver link, observed 2026-08-04T19:45:35.370242Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T19:45:35.370242Z digest=sha256:9cb68aafac6c6c1c4f0a564912a9bf7a3b6e0786f8c7894628c5a5f5be3437d7

Observation 3adadb00-0a3a-4261-834e-9934c7b85214 · inbound

A MARL Centered Reference Architecture for Large Language Model Augmentation in Smart Manufacturing cites this paper.

A MARL Centered Reference Architecture for Large Language Model Augmentation in Smart Manufacturing Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-10T14:00:57.575235Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:00:57.575235Z digest=sha256:f613444687e0a38d93b79d3850a9e0490ef122231c550e7b797c8f2fb9e39dff