Pith. sign in

Paper Citation Record · LEDGER

Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

As of 11 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 25 inbound Pith citation observations for arXiv:2309.11489.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2309.11489 v3

Coverage vector

measured 0 of 0 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links

measured 25 of 25 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 25 of 25 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-10T14:00:57.575235Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: pith, observed 2026-07-07T12:53:50.316535Z

Reference resolution

0 of 0 outbound references displayed

  • verified exact0
  • verified fuzzy0
  • unresolved0
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

No outbound reference observations are available for this paper version.

Pith citing papers

Observation 8740558b-4808-4940-86a3-12562da04c3f · inbound

VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models cites this paper.

VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 85

Resolution
verified exact
arxiv_id, observed 2026-05-13T08:57:22.356658Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-13T08:57:22.299028Z digest=sha256:4d3c2f5cf27a584afcfa9695a1641253a04f7480d0e54715ba1b8a753eccebb8

Observation a102b346-d097-4ca6-aa9d-2dbaf6820c14 · inbound

A Real-to-Sim-to-Real Approach to Robotic Manipulation with VLM-Generated Iterative Keypoint Rewards cites this paper.

A Real-to-Sim-to-Real Approach to Robotic Manipulation with VLM-Generated Iterative Keypoint Rewards Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-08T00:03:16.500490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-08T00:03:16.500490Z digest=sha256:74a7f63113961c582aa8e683c483b1cd18bfbe1568830cc8aedb51d4df246dde

Observation 174f6f66-0c2a-45e2-9233-ca45e25201a4 · inbound

Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems cites this paper.

Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 133

Resolution
verified exact
arxiv_id, observed 2026-05-22T21:42:10.816989Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-22T21:39:49.832151Z digest=sha256:d3a4738b15b05e86a3716726af56c906b105425245d1b8b098bfd8731b700634

Observation 869f221a-4444-4f51-bd69-bb2e6a21cab0 · inbound

HCRMP: A LLM-Hinted Contextual Reinforcement Learning Framework for Autonomous Driving cites this paper.

HCRMP: A LLM-Hinted Contextual Reinforcement Learning Framework for Autonomous Driving Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-07T15:13:43.841984Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T15:13:43.841984Z digest=sha256:741dfc6bbfa73b73bf3c2d0fe9e4256352ab027e55db2fed1895fe9119223184

Observation d0a81003-26d7-43ce-ba62-ae59e4f1d1e5 · inbound

Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning cites this paper.

Step-level Reward for Free in RL-based T2I Diffusion Model Fine-tuning Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-07T14:25:26.188530Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-07T14:25:26.188530Z digest=sha256:8790a0e225dbd93f09e6078301c053ce28c39a553ed85969d3ea0a416730d722

Observation 7a4f9053-a688-482a-ae85-e31501427ad3 · inbound

Text2Touch: Tactile In-Hand Manipulation with LLM-Designed Reward Functions cites this paper.

Text2Touch: Tactile In-Hand Manipulation with LLM-Designed Reward Functions Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-04T22:16:14.289687Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T22:16:14.289687Z digest=sha256:b1b5b5a723a0ff7525fb86e8f1f5ba45a76e7f2afb30ea340bed4f70401d6bff

Observation faf0f930-f3c5-4630-a678-b54619866c89 · inbound

Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning cites this paper.

Reward Evolution with Graph-of-Thoughts: A Bi-Level Language Model Framework for Reinforcement Learning Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-04T16:06:57.016648Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T16:06:57.016648Z digest=sha256:ba844ccc62ee7d5abcf04b6029474c5a184d7a66772e01d2fbfbe71f7e97545b

Observation 9f5e5edb-2f76-47dd-ab22-4e6287629dcd · inbound

LLM-Guided Task- and Affordance-Level Exploration in Reinforcement Learning cites this paper.

LLM-Guided Task- and Affordance-Level Exploration in Reinforcement Learning Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 23

Resolution
verified exact
arxiv_id, observed 2026-05-18T15:21:32.862328Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-18T15:19:30.609974Z digest=sha256:0f29e5391d25e215f8e39ea51d27814b1743e48a2be4f0b24b65283afbfb83d9

Observation 5fcb6402-7388-4175-8738-e944f9b01c1b · inbound

Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization cites this paper.

Efficient Onboard Vision-Language Inference in UAV-Enabled Low-Altitude Economy Networks via LLM-Enhanced Optimization Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-04T10:37:26.211102Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T10:37:26.211102Z digest=sha256:4aff79eaa833b6186adb2f3abbc9b5943a18983f9c519db9cbe2855dfad9630f

Observation 7b3121aa-73da-422d-9565-dc6e6dfe64e0 · inbound

EgoExo-Con: Exploring View-Invariant Video Temporal Understanding cites this paper.

EgoExo-Con: Exploring View-Invariant Video Temporal Understanding Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-04T07:23:07.784752Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-04T07:23:07.784752Z digest=sha256:0f9ed9ff28fa0d9ff3980cc41746472f5a6251dfa18651e2399978c045e1f2f7

Observation 5eddd61c-4bec-4df1-a17e-c6b1746cd718 · inbound

Automatic Generation of High-Performance RL Environments cites this paper.

Automatic Generation of High-Performance RL Environments Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-05-21T11:05:01.520674Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-21T11:04:11.718672Z digest=sha256:83ecd149889b123977c402401eb1445d0ad4faa4855e51eb608e809d9b0d0537

Observation 8caf378a-ab71-4dc1-b7e9-0f224c756884 · inbound

PR-CAD: Progressive Refinement for Unified Controllable and Faithful Text-to-CAD Generation with Large Language Models cites this paper.

PR-CAD: Progressive Refinement for Unified Controllable and Faithful Text-to-CAD Generation with Large Language Models Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-05-14T23:18:15.758972Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-14T23:17:29.025222Z digest=sha256:ba1e12c9c9e6fee49dae75f729dd06332eeea22f8e06b6a0b9e6cbd151db6457

Observation 38e963a9-50ad-4d1c-95f0-f9b0c1c28d83 · inbound

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning cites this paper.

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-09T06:00:35.206079Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-08T19:14:22.162163Z digest=sha256:b7fe21127fc251f89b186f77ecbf661279ad39d4e863a3f5cfd3735e269cfa9f

Observation 72f94d4b-0117-4a26-8472-e567430873dd · inbound

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning cites this paper.

Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 18

Resolution
verified exact
arxiv_id, observed 2026-05-11T03:50:57.895007Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-11T02:10:46.725354Z digest=sha256:d95796377b77bdf9c2593dbd6fe549cbb8ca6f461978ec55c43ee1e2690ba863

Observation c1a87110-1785-4874-bae1-e61994a20dc9 · inbound

SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning cites this paper.

SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 91

Resolution
verified exact
arxiv_id, observed 2026-05-12T06:21:26.415726Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-12T04:21:44.087943Z digest=sha256:ae22ea662a78eae523183068c002ed4e5bd8a4adb43d1081968a82fb1d83c9d1

Observation e8e8a514-64ad-41ec-9936-201378a99ba2 · inbound

SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning cites this paper.

SimWorld Studio: Automatic Environment Generation with Evolving Coding Agent for Embodied Agent Learning Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 91

Resolution
verified exact
arxiv_id, observed 2026-05-14T21:32:59.551200Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-14T21:30:42.766390Z digest=sha256:3ef85858638198caad1f28e1b3aa669fd63c94d8a57f0030f3fa4e9a8386a272

Observation 8dbef211-ee88-4f67-8fe5-8d0785d58fdb · inbound

EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models cites this paper.

EvoNav: Evolutionary Reward Function Design for Robot Navigation with Large Language Models Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 45

Resolution
verified exact
arxiv_id, observed 2026-05-13T05:27:18.909313Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-13T05:19:38.587352Z digest=sha256:b6d66701b5cb99493aa7256627714d556f91d44c121425d460815bcfc1fea9b5

Observation 42126c6e-4e3a-4f13-a566-4228b2b66bac · inbound

From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models cites this paper.

From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 19

Resolution
verified exact
arxiv_id, observed 2026-06-30T15:34:48.377018Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-30T15:25:14.906470Z digest=sha256:b78b570d32d5f5a544ded012a02a388f44f73fddc4cd1b107e682977e20d370c

Observation 88e32e35-6223-45a4-a682-cb088f22245a · inbound

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models cites this paper.

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 49

Resolution
verified exact
arxiv_id, observed 2026-07-03T18:28:48.875284Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-27T03:04:13.554098Z digest=sha256:743ec170f5942ba8129053a1f7e5be149d10a889dde5001c9c9cae53ed3bc4c7

Observation 6289b284-d96d-4818-964e-f2504f346da8 · inbound

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning cites this paper.

Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 235

Resolution
verified exact
arxiv_id, observed 2026-07-04T08:09:40.538848Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-06-26T12:15:08.304150Z digest=sha256:6fb23ced8fb835e162f19d004fcc29735b8ffb99264e907e5e60700f94fff02c

Observation 19b326fd-8551-41a7-91eb-26efa587dcb4 · inbound

LLM-as-a-Verifier: A General-Purpose Verification Framework cites this paper.

LLM-as-a-Verifier: A General-Purpose Verification Framework Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 82

Resolution
verified exact
local_arxiv, observed 2026-07-07T12:53:50.318343Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-07-07T12:47:29.552283Z digest=sha256:0e669a7b79a2cea6f534348cdfec59749a4097622dc4408790581a2dcd948562

Observation 452ca998-7168-4afb-8c1e-428707d1d97f · inbound

LLM-as-a-Verifier: A General-Purpose Verification Framework cites this paper.

LLM-as-a-Verifier: A General-Purpose Verification Framework Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 82

Resolution
unresolved
no resolver link, observed 2026-07-11T07:02:51.850836Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-11T07:02:51.850836Z digest=sha256:3c416a0d9cf8be358b8eb4960423911a61f1fb84ab92a2fe60afa1120a3f59a4

Observation 78f09d93-52dd-4add-9bea-8dfd62e6d254 · inbound

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback cites this paper.

Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-01T03:14:12.941468Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-01T03:14:12.941468Z digest=sha256:ac6c2b520cc8960408adbe9c7b53fc58830dfc815485d184335c2679a5fbf97c

Observation f020b07f-da1a-4fd7-9999-e83625f0a3d3 · inbound

Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills cites this paper.

Weights or Skills? A Survey of Robot-Learning Techniques: from Action-Predicting Weights to Robots that Write their Own Skills Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 280

Resolution
unresolved
no resolver link, observed 2026-08-04T19:45:35.370242Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-04T19:45:35.370242Z digest=sha256:9cb68aafac6c6c1c4f0a564912a9bf7a3b6e0786f8c7894628c5a5f5be3437d7

Observation 3adadb00-0a3a-4261-834e-9934c7b85214 · inbound

A MARL Centered Reference Architecture for Large Language Model Augmentation in Smart Manufacturing cites this paper.

A MARL Centered Reference Architecture for Large Language Model Augmentation in Smart Manufacturing Text2Reward: Reward Shaping with Language Models for Reinforcement Learning

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-10T14:00:57.575235Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-10T14:00:57.575235Z digest=sha256:cf4e64d2c204fc69f73d3b125b43cedd71f8576962cc0b50d71c91e8de4735d3