Pith. sign in

Paper Citation Record · LEDGER

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1

As of 19 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 3 inbound Pith citation observations for arXiv:2506.19235.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2506.19235 v1

Coverage vector

measured 39 of 39 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T23:12:33.875901Z

measured 42 of 42 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-19T06:32:44.657259+00:00

measured 3 of 3 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-07-31T15:16:36.284072Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-01T17:25:51.272020Z

Reference resolution

39 of 39 outbound references displayed

  • verified exact0
  • verified fuzzy11
  • unresolved28
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 97ae766d-9af7-486d-8c84-23a3e1a74090 · outbound

This paper cites GPT-4 Technical Report.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 GPT-4 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:30.692673Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:30.692673Z digest=sha256:c7646d7227997b059f9f2bf9fbbc7db302602b2c56ae2f65a9f590e4df697bfe

Observation 34b0f6be-4581-4066-aff6-85c6a3977597 · outbound

This paper cites Reinforcement learning based recommender systems: A survey.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Reinforcement learning based recommender systems: A survey

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:30.725331Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:30.725331Z digest=sha256:c6d51135c0396e4d8e947592d5eb0af1ebe964b82e1143fd3093aa7ce12d67b4

Observation 130a9e2c-3b63-4d38-9bf0-4fa19e436d94 · outbound

This paper cites Language models are few-shot learners.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Language models are few-shot learners

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:30.805607Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:30.805607Z digest=sha256:a2a6dd2d88ad2a7a93967e9ba3896318b41490e138823e16b50639b984b007cc

Observation e760fceb-6a17-4112-99ae-838258a2de64 · outbound

This paper cites Twin: Two-stage interest network for lifelong user behavior modeling in ctr prediction at kuaishou.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Twin: Two-stage interest network for lifelong user behavior modeling in ctr prediction at kuaishou

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:35.662028Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:30.883121Z digest=sha256:030802416b6fad37f318fb15583face763afd78e15b0c743bca70f65a86b1cc9

Observation eed36b7d-a357-4938-98a8-6bf3c507493d · outbound

This paper cites Wide & deep learning for recommender systems.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Wide & deep learning for recommender systems

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:35.608732Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:30.968617Z digest=sha256:9fe1f2a1ffe290ef7b43b183a2e88b756f5d08169006c50f67946ea945cef3fc

Observation 24ee761f-9be1-44eb-8546-972628a2ca31 · outbound

This paper cites Deep neural networks for youtube recommenda- tions.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Deep neural networks for youtube recommenda- tions

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:35.408453Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:31.060338Z digest=sha256:ee266df2dc29d5a9b0531b1dcb152981bfcb30b8118fcdafba523aa9c692cc3b

Observation 7a2d09e1-dc40-4535-8cb9-a20d9ac91fbd · outbound

This paper cites Flashattention: Fast and memory-efficient exact attention with io-awareness.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Flashattention: Fast and memory-efficient exact attention with io-awareness

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:31.185452Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:31.185452Z digest=sha256:5ed1b93b7bbadbba241167f499fa48b2c42cb026250411f5110dcb4b1c9a1cd2

Observation bc6abfcb-890a-4e8f-927e-4da5563e87b3 · outbound

This paper cites Bert: Pre-training of deep bidirectional transformers for language understanding.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Bert: Pre-training of deep bidirectional transformers for language understanding

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:31.298128Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:31.298128Z digest=sha256:2cefab880e18b3808614371cb2185f4babbf0f06f6d271dbf3f335c0941611d3

Observation c42f9214-9bfe-4dbc-8201-f17b69056f76 · outbound

This paper cites DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:31.465019Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:31.465019Z digest=sha256:514579b02536412c7e3b423ffd54f7aeba1c07554f3c25900fb080c69ca64334

Observation 28801878-da4f-4c7c-8d31-ec04558d3def · outbound

This paper cites DeepFM: A Factorization-Machine based Neural Network for CTR Prediction.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 DeepFM: A Factorization-Machine based Neural Network for CTR Prediction

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:31.633989Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:31.633989Z digest=sha256:cb3a2881f0993233b90fc6e941c229b20749561cde4196b936f915f305031406

Observation c2c7126d-f7b1-45eb-ae0a-6b06c28c8506 · outbound

This paper cites Ups and downs: Modeling the visual evolution of fashion trends with one-class collaborative filtering.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Ups and downs: Modeling the visual evolution of fashion trends with one-class collaborative filtering

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:31.742209Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:31.742209Z digest=sha256:5dba8137b3592df5724c16f1c8788a99aa28b6ab4a8c64c0ba43e28997d1d692

Observation ea9f42bd-c89a-4cf1-b46f-25804ee9904f · outbound

This paper cites Neural collaborative filtering.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Neural collaborative filtering

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:31.831740Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:31.831740Z digest=sha256:1900dbdd6cab1b1e98230359f0b687f4c5cdaf9fab137475af7a0c023c07b464

Observation 5c2f5c2d-7d15-4d33-8493-b03ab0e29e96 · outbound

This paper cites Session-based Recommendations with Recurrent Neural Networks.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Session-based Recommendations with Recurrent Neural Networks

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:31.924775Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:31.924775Z digest=sha256:1cac6004bf3d5c89e7b5a2a3abdbae4a166eef6f0d5be20ee26f985a87dbdf3c

Observation 5b11b211-b806-45c7-a53d-dc24d565891f · outbound

This paper cites Factual and Personalized Recommendations using Language Models and Reinforcement Learning.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Factual and Personalized Recommendations using Language Models and Reinforcement Learning

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:32.008803Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:32.008803Z digest=sha256:afd2caf70a36443fc490503fda2b67ce967bd5eb64dec5a6a7f8d94ad9e6c79d

Observation 7e9e8c6e-888d-46b0-ae30-8a298d9a3f66 · outbound

This paper cites Genrec: Large language model for generative recommendation.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Genrec: Large language model for generative recommendation

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:35.268155Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:32.075922Z digest=sha256:faf74206b55845e5da7086229499693d4bcdba00bb2f8627f1203d966ef65029

Observation 9f4f6a9e-d85c-4ac2-b6ca-0cb54f9f9c80 · outbound

This paper cites Self-attentive sequential recommendation.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Self-attentive sequential recommendation

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:32.145328Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:32.145328Z digest=sha256:08ec9c10a578bfb4f8e32c0f6826519dd79c83ce2f45f6b685cc97dadd33f6b4

Observation 378042bc-9a5b-426e-ad55-61dc63f23aad · outbound

This paper cites Matrix factorization techniques for recom- mender systems.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Matrix factorization techniques for recom- mender systems

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:32.213858Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:32.213858Z digest=sha256:eaaf2716b778315ce4e29a3b886b3abffe4e4caadc62826b8b04228433b60ce0

Observation 3898939a-803c-4bef-b330-1e6d4fa7d26b · outbound

This paper cites GPT4Rec: A Generative Framework for Personalized Recommendation and User Interests Interpretation.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 GPT4Rec: A Generative Framework for Personalized Recommendation and User Interests Interpretation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:32.288506Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:32.288506Z digest=sha256:fafed68eca4695b7733a7dba7d33eda99a5148dcf2c10d515d7e3b3c26e4ac8f

Observation 9daa28f9-c4e3-4621-b328-396bd34e7994 · outbound

This paper cites Llara: Large language-recommendation assistant.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Llara: Large language-recommendation assistant

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:35.153438Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:32.369158Z digest=sha256:de3875e7aa6d221fab704e93524a33fe3b81af89883fb8cb5b7fae9b41f901a4

Observation ef15a54c-ffdd-406b-b832-fa79fd60956a · outbound

This paper cites Cascade ranking for operational e-commerce search.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Cascade ranking for operational e-commerce search

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:35.087673Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:32.461444Z digest=sha256:707d6075e492860c6e0e9c63193df44fe2d97548ff6ffae5db7a65da561ab489

Observation ffb7c52d-7b33-4c9f-a3e8-666fd7c90c46 · outbound

This paper cites Integrating large language models into recommendation via mutual augmentation and adaptive aggregation.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Integrating large language models into recommendation via mutual augmentation and adaptive aggregation

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:32.519992Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:32.519992Z digest=sha256:2765d9de916b1307b3cb7e4297f9374b3e5857f86c4d8b470b89dc7248d339b7

Observation f047dc14-655c-4a39-ac5f-a4da5245144b · outbound

This paper cites Human-level control through deep reinforcement learning.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Human-level control through deep reinforcement learning

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:32.644503Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:32.644503Z digest=sha256:fb56d13f0ca33ed57e55f6676420bd5873e058710f0306114b108b971e88ac49

Observation 5d034671-8f2e-45a7-81f1-49609fe7a2db · outbound

This paper cites Training language models to follow instructions with human feedback.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Training language models to follow instructions with human feedback

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:32.713350Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:32.713350Z digest=sha256:e923363636e6a5b04877702103220f99111b60963d5f3b06e97b970f3a966c68

Observation fdef5190-5935-4a90-a143-b96c92849146 · outbound

This paper cites Large language model based long-tail query rewriting in taobao search.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Large language model based long-tail query rewriting in taobao search

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:34.967595Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:32.792471Z digest=sha256:ee77a3d7cc5db1ffbb60392046f4497035723d6b971009b70f5ee85034602a16

Observation 057d0cc7-415f-4deb-83d2-6910b71dc400 · outbound

This paper cites Rankflow: Joint optimization of multi-stage cascade ranking systems as flows.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Rankflow: Joint optimization of multi-stage cascade ranking systems as flows

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:34.937120Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:32.865754Z digest=sha256:bcb472739605a263cdf71a36a4efbe11a28e6b1493313eea43311fbaffc4a39b

Observation e4ad6fc9-d1e7-44a4-9888-a0ac34df5051 · outbound

This paper cites Direct preference optimization: Your language model is secretly a reward model.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Direct preference optimization: Your language model is secretly a reward model

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:32.938700Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:32.938700Z digest=sha256:a4ae508c41cf291715e477b0448c8c6b645c56c6123a9cb05f919ff1badd1a5a

Observation 9dbbb977-4b79-4568-8da1-7b7093d4630f · outbound

This paper cites Recommender systems with generative retrieval.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Recommender systems with generative retrieval

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.010097Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.010097Z digest=sha256:2d24687d61ca0063e7242b8496966fc01080fa4be2cd365874f1581d4b98f587

Observation b9f09756-f522-4026-be76-82782b589466 · outbound

This paper cites Proximal Policy Optimization Algorithms.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Proximal Policy Optimization Algorithms

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.093052Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.093052Z digest=sha256:ca3189449700611601c3e4215e6330b1ea2cf642eecfaf900c9bc084a6cacd98

Observation 3789c514-58a4-4d09-91aa-d06644610368 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.171005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.171005Z digest=sha256:c8fe33bfe8861db3003cd078a27334bf699f53345068d725d4282bca32a1dd42

Observation 6d76c055-c758-4975-b431-e0b0da8ffbc5 · outbound

This paper cites HybridFlow: A Flexible and Efficient RLHF Framework.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 HybridFlow: A Flexible and Efficient RLHF Framework

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.229167Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.229167Z digest=sha256:c6c44650d93e3378d8fe7ff62b621ddb7b69ee1624684af5431dc70b2dc448fa

Observation 9f5341ee-59b9-4769-b59f-56cbbad49b78 · outbound

This paper cites Learning to summarize with human feedback.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Learning to summarize with human feedback

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.308287Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.308287Z digest=sha256:97c5b1d79090763c45b90e466d38140aebcfdb1bff98260b013a12cd04982de5

Observation 4e3bc0a5-59c6-44f5-97d9-3cc99f7c03ef · outbound

This paper cites Bert4rec: Sequential recommendation with bidirectional encoder representations from transformer.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Bert4rec: Sequential recommendation with bidirectional encoder representations from transformer

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:34.807458Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:33.359428Z digest=sha256:c5a6d1a3882fb1a886dce20645aeee6186aaa80810364196ddcd5d317b1e7dcc

Observation 2c78550a-e9ff-452b-bcbf-efc5fc1b878f · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 LLaMA: Open and Efficient Foundation Language Models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.416496Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.416496Z digest=sha256:1b65a0240f4d87ac32507d775c3fd2e4fe1177943566944fe451fd6be65ff5e6

Observation 097aa803-1f42-4562-ab1e-f0891b819b15 · outbound

This paper cites Kerl: A knowledge-guided reinforcement learning model for sequential recommendation.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Kerl: A knowledge-guided reinforcement learning model for sequential recommendation

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:34.565605Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:33.538034Z digest=sha256:5d46351305e7aecadb1547f8e90a095b89330acdbcf7c8d1544ee4bba22c1a02

Observation 99a8b067-e3fc-4988-a874-df705a14f3f4 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Chain-of-thought prompting elicits reasoning in large language models

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.615151Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.615151Z digest=sha256:47239caa73af5af0129a519a9e2a5ab424664408c9901e9e64cfbe83133aa827

Observation 6bd8d4bf-7194-45c8-b172-be0827d6c01a · outbound

This paper cites PALR: Personalization Aware LLMs for Recommendation.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 PALR: Personalization Aware LLMs for Recommendation

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.694178Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.694178Z digest=sha256:185a5fdb7435d6aba7805be0de1d97e2eb46dc4223db852a3d7974f3900822e0

Observation 481ac885-beb2-4f72-a162-7174c3a6be73 · outbound

This paper cites Feature-level deeper self-attention network for sequential recommendation.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Feature-level deeper self-attention network for sequential recommendation

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T23:12:34.300878Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-08-06T23:12:33.767884Z digest=sha256:2dc007cdf4a5cffe29044528b39b9fb85616e4cbc042117fc4ee45702f5545db

Observation 2cb6e1b4-a622-47e9-96fe-14893ee14302 · outbound

This paper cites Deep interest network for click-through rate prediction.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 Deep interest network for click-through rate prediction

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.831335Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.831335Z digest=sha256:0eb7a71593888c29f05a546bdfa9aeb37918d6902cb9025077b39461993a7088

Observation 37362ac1-d24e-4014-b74e-2b2e02f3b96a · outbound

This paper cites S3-rec: Self-supervised learning for sequential recommendation with mutual information maximization.

RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1 S3-rec: Self-supervised learning for sequential recommendation with mutual information maximization

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-06T23:12:33.875901Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T23:12:33.875901Z digest=sha256:d4079d82807de2aa7f9f60f99f8f92a8748df94e63c883e6c156e041bbf62f15

Pith citing papers

Observation 13e11885-dd8a-4e4c-8915-2f8240635264 · inbound

RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems cites this paper.

RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1

Reference 43

Resolution
verified exact
arxiv_id, observed 2026-05-13T05:07:17.520568Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-05-13T05:04:08.454422Z digest=sha256:84aa55a2d5ff4262c980765373a7fec8953a8860657f4fcadf2f74def37b31c2

Observation 9ca45276-c3f9-447a-b9eb-192a5ea914a9 · inbound

Intuition-Guided Latent Reasoning for LLM-Based Recommendation cites this paper.

Intuition-Guided Latent Reasoning for LLM-Based Recommendation RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1

Reference 57

Resolution
verified exact
arxiv_id, observed 2026-07-01T17:25:51.273725Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.

source=pdf_text observed=2026-06-29T03:46:05.076346Z digest=sha256:4f7daec3f45aaadebe06bc647ceb34257c46a1b5edfb2fc234c9bcececc37489

Observation 256a2bc7-e757-49fd-98e6-8408da8096ee · inbound

MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning cites this paper.

MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1

Reference 18

Resolution
unresolved
no resolver link, observed 2026-07-31T15:16:36.284072Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-07-31T15:16:36.284072Z digest=sha256:0f16a6fad48098b34efffa94bc5f2c32d16fd36d7e95275e366e1ee69a339729