Pith. sign in

Paper Citation Record · LEDGER

Reinforced Language Models for Sequential Decision Making

As of 10 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 2 inbound Pith citation observations for arXiv:2508.10839.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.10839 v1

Coverage vector

measured 43 of 43 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T20:20:56.723685Z

measured 45 of 45 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 2 of 2 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-13T06:44:28.552513Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-13T06:47:27.135925Z

Reference resolution

43 of 43 outbound references displayed

  • verified exact0
  • verified fuzzy6
  • unresolved37
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation cc974d6f-2720-497d-8179-7b6803162c93 · outbound

This paper cites , " * write output.state after.block = add.period write newline.

Reinforced Language Models for Sequential Decision Making , " * write output.state after.block = add.period write newline

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:21:00.378253Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:53.559913Z digest=sha256:3d9ff95eb25bb9b1bf5946b11794db8cbadbdc44024c5216b38b94628c3fc01a

Observation 6786b4fd-cb1d-4dfe-8e02-4f79bbaabca2 · outbound

This paper cites write newline.

Reinforced Language Models for Sequential Decision Making write newline

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:53.598487Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:53.598487Z digest=sha256:a1994c70770f6d51e860d6a138d25b24a3ccf3571f4adcdcf758d64266c8f7b6

Observation 9f7e173b-2edd-4965-82cb-0502505ecd5f · outbound

This paper cites an unresolved cited work.

Reinforced Language Models for Sequential Decision Making Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:53.664054Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:53.664054Z digest=sha256:e97fd7afd3d6310c63371ff1509863bf3e9854fb1ebb1d6168b7d338b3fb16f2

Observation a85edd25-c227-4cdc-a376-494d2f734fb4 · outbound

This paper cites an unresolved cited work.

Reinforced Language Models for Sequential Decision Making Unresolved cited work

Reference 4

Resolution
unresolved
raw_fallback, observed 2026-08-05T20:21:00.200912Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:53.739760Z digest=sha256:7a705d8450e6d653dcd4203f09c9caaeb34003b968f3133963e0867da33f9c1a

Observation fe43891f-efe5-4332-88fd-ba8d3b1a22d2 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

Reinforced Language Models for Sequential Decision Making DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:53.799169Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:53.799169Z digest=sha256:442fb5bf0bb27f43c3f767c43e7a6ac5515c7ec7217d2984169e6526503a86bf

Observation 211b3b15-0822-47f1-a202-816c7a2cd241 · outbound

This paper cites an unresolved cited work.

Reinforced Language Models for Sequential Decision Making Unresolved cited work

Reference 6

Resolution
unresolved
raw_fallback, observed 2026-08-05T20:21:00.069380Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:53.864907Z digest=sha256:0012ec9b47ac1a524209dbf32de330e311539abf0c8e0eacfb4bdefb88ed6708

Observation 6331ee09-c3a0-4477-8cb5-3373dce81642 · outbound

This paper cites an unresolved cited work.

Reinforced Language Models for Sequential Decision Making Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-05T20:20:59.923308Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:53.936107Z digest=sha256:9eae304f4f4d8dd2d8a7a12156e1b6be39b6e7cd23aa79c61f24de78076b2f02

Observation a35cd3c0-c1b6-4e4b-bdbb-680e44d431d2 · outbound

This paper cites A.; Bernstein, D.

Reinforced Language Models for Sequential Decision Making A.; Bernstein, D

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:20:59.819666Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:54.029675Z digest=sha256:00cd34e63eeb4b741acd51eaf0121861ebe8d16baeae2210b51dd76992486fe0

Observation c16c6a00-d1fe-4f2f-a93f-369528e211ca · outbound

This paper cites T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling.

Reinforced Language Models for Sequential Decision Making T1: Advancing Language Model Reasoning through Reinforcement Learning and Inference Scaling

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:54.083020Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:54.083020Z digest=sha256:c6482737da5626d453041b5f79132803eba983701fbe99a361a1909c4138fa45

Observation 8b7cefc6-3ed0-4b60-8b31-63ef294136ee · outbound

This paper cites an unresolved cited work.

Reinforced Language Models for Sequential Decision Making Unresolved cited work

Reference 10

Resolution
unresolved
raw_fallback, observed 2026-08-05T20:20:59.658999Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:54.126520Z digest=sha256:a47d13034569864276023363ad31747fbce81360f8faa1566907bea9ed4c6925

Observation 24b0cb18-55f0-4650-b89c-637c4f8ce916 · outbound

This paper cites an unresolved cited work.

Reinforced Language Models for Sequential Decision Making Unresolved cited work

Reference 11

Resolution
unresolved
raw_fallback, observed 2026-08-05T20:20:59.551565Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:54.236148Z digest=sha256:acc1e5e3629ba06f9fc1be1d9b1f59c511e4193e421dc1a4c815624a8e330f6d

Observation 928fb816-b6c9-4941-9b71-324f10ca7d27 · outbound

This paper cites an unresolved cited work.

Reinforced Language Models for Sequential Decision Making Unresolved cited work

Reference 12

Resolution
unresolved
raw_fallback, observed 2026-08-05T20:20:59.435228Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:54.301771Z digest=sha256:73db8db750d3016691b45013a834ba438868224086f1f7f8ce55dfb126447691

Observation 8a8570bd-8a71-442c-b15f-4fe34a1b0797 · outbound

This paper cites an unresolved cited work.

Reinforced Language Models for Sequential Decision Making Unresolved cited work

Reference 13

Resolution
unresolved
raw_fallback, observed 2026-08-05T20:20:59.288591Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:54.361663Z digest=sha256:5bcf60493b2ec3334782e1078095ec75204f91f33f044ddf97a11794058a25fc

Observation d9191b20-4cca-4422-824f-2d124ffdc844 · outbound

This paper cites HMCF: A Human-in-the-loop Multi-Robot Collaboration Framework Based on Large Language Models.

Reinforced Language Models for Sequential Decision Making HMCF: A Human-in-the-loop Multi-Robot Collaboration Framework Based on Large Language Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:54.486456Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:54.486456Z digest=sha256:d5852816994c8c602c4aa07c44e5cefcaf1faf22273857ed8c5a69831667821a

Observation a12a504d-2e2d-4c62-81a3-dd81429bcd31 · outbound

This paper cites Playing Atari with Deep Reinforcement Learning.

Reinforced Language Models for Sequential Decision Making Playing Atari with Deep Reinforcement Learning

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:54.531721Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:54.531721Z digest=sha256:ed381874f3d2185fa15a7442dce7d63c74c467450eec7f25110efec181127ea6

Observation a2b58967-429c-4a92-99c2-94d717356c35 · outbound

This paper cites ROS-LLM: A ROS framework for embodied AI with task feedback and structured reasoning.

Reinforced Language Models for Sequential Decision Making ROS-LLM: A ROS framework for embodied AI with task feedback and structured reasoning

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:54.604148Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:54.604148Z digest=sha256:81888dc214386e060a908bbb257c16e703d41f3e61435ad8092aa0d37900f30f

Observation e3cdc1d5-b022-4c21-801d-868b5f0f3c3a · outbound

This paper cites an unresolved cited work.

Reinforced Language Models for Sequential Decision Making Unresolved cited work

Reference 17

Resolution
unresolved
raw_fallback, observed 2026-08-05T20:20:59.108432Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:54.684439Z digest=sha256:9184be5589ad83139b17212a3abd48290f397eb09547ca91341dba4dab240068

Observation 5d520b1a-4fe6-4431-a27a-8e6ab58e5c4c · outbound

This paper cites GPT-4o System Card.

Reinforced Language Models for Sequential Decision Making GPT-4o System Card

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:54.757877Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:54.757877Z digest=sha256:5cfdbbad1aaecbff304968030a297ce2d8ffa8a3b80efb377174a00330e87107

Observation 292b3ed9-5318-4fad-9e5d-8a22f21c988e · outbound

This paper cites L.; Mishkin, P.; Zhang, C.; et al.

Reinforced Language Models for Sequential Decision Making L.; Mishkin, P.; Zhang, C.; et al

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:20:58.945154Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:54.857337Z digest=sha256:d4ee19b07448c1091cb466661a4c7c70642e3650085a89857eef723bda504c93

Observation 2086a6f9-418d-40f4-b5a4-18d3fbaad7c4 · outbound

This paper cites E.; Zhang, K.; and Kim, J.-K.

Reinforced Language Models for Sequential Decision Making E.; Zhang, K.; and Kim, J.-K

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:20:58.761059Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:54.904478Z digest=sha256:03dabc0e4a48485198d733e1dc06581dc2de01cf86beb9b2b9f28be8642d8788

Observation 71ab2df3-6d4c-4faa-acd8-83a998f305dd · outbound

This paper cites Qwen2.5 Technical Report.

Reinforced Language Models for Sequential Decision Making Qwen2.5 Technical Report

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:54.970183Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:54.970183Z digest=sha256:a9e78f35b59aa4bebb7cc7a8b43f16143cc523cea3ef0709a68a2741630709a2

Observation 0f2007e4-d43b-4ece-837b-84e0da47fcc6 · outbound

This paper cites D.; Ermon, S.; and Finn, C.

Reinforced Language Models for Sequential Decision Making D.; Ermon, S.; and Finn, C

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:20:58.602951Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:55.087607Z digest=sha256:40b628eb29d9680ddfcce2a670ccb23dad55eb031c2aa0343bc2c7a08b2eb1c9

Observation a9c1cf07-8a3e-405c-80ad-0554d94eb40b · outbound

This paper cites an unresolved cited work.

Reinforced Language Models for Sequential Decision Making Unresolved cited work

Reference 23

Resolution
unresolved
raw_fallback, observed 2026-08-05T20:20:58.427076Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:55.134546Z digest=sha256:6c3e8d21a375f4a9b091712211cf1bde3d8d6aa275440168f151a3f6fe1128f1

Observation a4e8f578-d9bd-4c4e-9317-a8bbb40a3c05 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Reinforced Language Models for Sequential Decision Making Proximal Policy Optimization Algorithms

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:55.288861Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:55.288861Z digest=sha256:3a064fceaf38aa2d05bc3803d037c7ebf4e50548b834dada18422510e0057ae3

Observation 01358c47-70f4-42e0-908f-653b73d2922d · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

Reinforced Language Models for Sequential Decision Making DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:55.391055Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:55.391055Z digest=sha256:4b9e3ab4b594ca69c91fa3f1f16777193bba0f261f3247bb894f3acdf9126e0b

Observation c3d96199-7a37-41cf-8670-755e8fc51ade · outbound

This paper cites an unresolved cited work.

Reinforced Language Models for Sequential Decision Making Unresolved cited work

Reference 26

Resolution
unresolved
raw_fallback, observed 2026-08-05T20:20:58.232517Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:55.492438Z digest=sha256:dcbd95907a08def206a2c50fdb0ad5a4db4efed3c0f5df8af564443f99a3ccb8

Observation 9bbcb265-1e03-4565-aa61-613f49a04724 · outbound

This paper cites an unresolved cited work.

Reinforced Language Models for Sequential Decision Making Unresolved cited work

Reference 27

Resolution
unresolved
raw_fallback, observed 2026-08-05T20:20:58.085462Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:55.589226Z digest=sha256:5cefbc0d0d9eb90d22857623e89d85e037c52abd56e35b13f67167d4c23bd885

Observation 7685cd1e-7d05-46b8-90dd-410be04f9488 · outbound

This paper cites S.; and Barto, A.

Reinforced Language Models for Sequential Decision Making S.; and Barto, A

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T20:20:57.893391Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:55.665050Z digest=sha256:da9020f5d0995eb7da61fef05e7e0065b37e76c70df31a988b4ddac2e0d0e1cd

Observation abc864c5-5297-4f6a-9b4b-d9f0d577812a · outbound

This paper cites Evaluation of Large Language Models for Decision Making in Autonomous Driving.

Reinforced Language Models for Sequential Decision Making Evaluation of Large Language Models for Decision Making in Autonomous Driving

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:55.719918Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:55.719918Z digest=sha256:26d046916ce99518412732e6a4409ba7221934001053c0efda9fcc0e77953465

Observation 89f3a3cf-3e89-4dfa-88ac-74780d480c2f · outbound

This paper cites Gymnasium: A Standard Interface for Reinforcement Learning Environments.

Reinforced Language Models for Sequential Decision Making Gymnasium: A Standard Interface for Reinforcement Learning Environments

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:55.795118Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:55.795118Z digest=sha256:d5f53d2b940d1e1fc574bd830ac65d83fc6f9d4a01fec5747c7b7d1edf26eeb5

Observation 7dd9dd30-5aab-4cc1-9ac1-a8b1a95dda1a · outbound

This paper cites an unresolved cited work.

Reinforced Language Models for Sequential Decision Making Unresolved cited work

Reference 31

Resolution
unresolved
raw_fallback, observed 2026-08-05T20:20:57.761463Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:55.912306Z digest=sha256:43f487502e8af522f6aadcdabc110b9f65c2922dcd2abae2efb4b30cb9236639

Observation dc262115-c184-4fe5-b0d6-36fa21ffa1a7 · outbound

This paper cites an unresolved cited work.

Reinforced Language Models for Sequential Decision Making Unresolved cited work

Reference 32

Resolution
unresolved
raw_fallback, observed 2026-08-05T20:20:57.616584Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:55.962220Z digest=sha256:790b556dc7e73f5592ccf9b6c9e333b9a111df4c2020a09e4f9028e331d6b7be

Observation 5f42ce11-bc78-47e2-af30-ec53f906a553 · outbound

This paper cites Reinforcement Learning for Reasoning in Large Language Models with One Training Example.

Reinforced Language Models for Sequential Decision Making Reinforcement Learning for Reasoning in Large Language Models with One Training Example

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:56.054801Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:56.054801Z digest=sha256:2943863d9742a2e64e002406e0f01fcf38632b6225e52da8fdbaf282664af1a1

Observation 8aaccf3a-20ba-495a-88f2-cf358bd7790b · outbound

This paper cites RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning.

Reinforced Language Models for Sequential Decision Making RAGEN: Understanding Self-Evolution in LLM Agents via Multi-Turn Reinforcement Learning

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:56.119890Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:56.119890Z digest=sha256:9b19c66f98273f24b0eebd7cce236caec2167fe964e6b026542b2984e50a6ab1

Observation 7aa594cb-4c8a-478f-ae57-3b1519b1ff55 · outbound

This paper cites an unresolved cited work.

Reinforced Language Models for Sequential Decision Making Unresolved cited work

Reference 35

Resolution
unresolved
raw_fallback, observed 2026-08-05T20:20:57.427388Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:56.176557Z digest=sha256:db84f1cb9c7bdb67b5ba2be3a3a36a53063840cfa2bf70b955632a0073ccccaf

Observation 3486c8ef-1a95-45c4-9c0e-dbe2f1a955d4 · outbound

This paper cites ReAct: Synergizing Reasoning and Acting in Language Models.

Reinforced Language Models for Sequential Decision Making ReAct: Synergizing Reasoning and Acting in Language Models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:56.253277Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:56.253277Z digest=sha256:e55ac7430b2aa47794d5428fa46a3ad01efea965dd5e9020b827556211b5397d

Observation c039a950-0021-4e08-ad64-583bfbda2dcc · outbound

This paper cites DAPO: An Open-Source LLM Reinforcement Learning System at Scale.

Reinforced Language Models for Sequential Decision Making DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:56.318703Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:56.318703Z digest=sha256:2554061beabdd389228865669138896df55b637459dccb8344b6677d3d523163

Observation 480a7a2d-b987-4bcd-b671-16d83a504fa6 · outbound

This paper cites Building Cooperative Embodied Agents Modularly with Large Language Models.

Reinforced Language Models for Sequential Decision Making Building Cooperative Embodied Agents Modularly with Large Language Models

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:56.360454Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:56.360454Z digest=sha256:8220de8b8db2a0b4a746ab22dc71f4c12318d927a9a09171765cb019a004160c

Observation f19ef7d3-1b2c-4a0d-9504-ef08ea9118b9 · outbound

This paper cites Group Sequence Policy Optimization.

Reinforced Language Models for Sequential Decision Making Group Sequence Policy Optimization

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:56.475462Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:56.475462Z digest=sha256:cb4ac07ee995aeaa57f7fe4dd549fde87fde9a409d2c1f5843a9ae8ba12b7e49

Observation 5bed92c2-63fe-4f30-be1e-1285c0b08239 · outbound

This paper cites DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments.

Reinforced Language Models for Sequential Decision Making DeepResearcher: Scaling Deep Research via Reinforcement Learning in Real-world Environments

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:56.530570Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:56.530570Z digest=sha256:2ef11c53ea71ca6c0d6dc788363924758b878ec74d5ea6c1671ee8982961c3ad

Observation 50ee1f6f-2450-4e74-b775-ef523dadca71 · outbound

This paper cites DPO Meets PPO: Reinforced Token Optimization for RLHF.

Reinforced Language Models for Sequential Decision Making DPO Meets PPO: Reinforced Token Optimization for RLHF

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:56.616695Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:56.616695Z digest=sha256:d37d4a0c157d756ecf3c99d4067caa465fd29a56867281b3fc89d93e5eb9eeb8

Observation 34b45a5f-aca1-4bfe-a42f-8cc1569ff09b · outbound

This paper cites an unresolved cited work.

Reinforced Language Models for Sequential Decision Making Unresolved cited work

Reference 42

Resolution
unresolved
raw_fallback, observed 2026-08-05T20:20:57.294600Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=arxiv_source observed=2026-08-05T20:20:56.693887Z digest=sha256:74e36e76d3fe9b6d36fa20a913ae387ba3dcafa5bb40e2c10de10355962065f0

Observation 30982ed7-f0ed-41fd-8af0-906022070f59 · outbound

This paper cites Fine-Tuning Language Models from Human Preferences.

Reinforced Language Models for Sequential Decision Making Fine-Tuning Language Models from Human Preferences

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-05T20:20:56.723685Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T20:20:56.723685Z digest=sha256:4559a2afa58fb6c28e41b951b2d2c9e177d14a4977abbeab18fed5fc79a45a81

Pith citing papers

Observation 759d0bba-280a-4393-9ad9-cc3baaeb6ec2 · inbound

Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse cites this paper.

Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse Reinforced Language Models for Sequential Decision Making

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-12T03:26:19.011453Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-12T03:25:24.844859Z digest=sha256:cf6dd613b4401e1c12d96026b9a58cc94c05f87255f3be7582b9256fa4ad4ecb

Observation 8bf19e1c-060b-42d3-80d1-189e0a0ccc6c · inbound

Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse cites this paper.

Towards Generalist Game Players: An Investigation of Foundation Models in the Game Multiverse Reinforced Language Models for Sequential Decision Making

Reference 36

Resolution
verified exact
arxiv_id, observed 2026-05-13T06:47:27.138826Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-05-13T06:44:28.552513Z digest=sha256:0275b1506e80c796eb6762a0f075076ba5d55439c05426927b4142e58766b2e0