{"as_of":"2026-08-14T07:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c010308500e9e32f2a51ddad0990cc59c80d6afdea7d2f9c73a51706aa24c699","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:12:33.875901Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T15:16:36.284072Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T17:25:51.272020Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"cited_work":{"arxiv_id":"2506.19235","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19235","snapshot_observed_at":"2026-07-01T17:25:51.272020Z","title":null,"venue":null,"work_id":"73ea0f8a-d0e7-4ec1-86e2-b55fbae0c74b","year":2025},"citing_paper":{"arxiv_id":"2605.11874","last_updated":"2026-05-12T09:52:21Z","snapshot_observed_at":"2026-08-13T03:38:04.870787Z","submitted_at":"2026-05-12T09:52:21Z","title":"RecRM-Bench: Benchmarking Multidimensional Reward Modeling for Agentic Recommender Systems","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T05:04:08.454422Z"},"links":{"cited_paper":"/paper/2506.19235","citing_paper":"/paper/2605.11874"},"observation_digest":"sha256:756ffc3349a0d5246ccb9a71c2348315cebc54a98b4da0117ec16498ae0bed35","observation_id":"13e11885-dd8a-4e4c-8915-2f8240635264","resolution":{"observed_at":"2026-05-13T05:07:17.520568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"cited_work":{"arxiv_id":"2506.19235","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.19235","snapshot_observed_at":"2026-07-01T17:25:51.272020Z","title":null,"venue":null,"work_id":"73ea0f8a-d0e7-4ec1-86e2-b55fbae0c74b","year":2025},"citing_paper":{"arxiv_id":"2606.27684","last_updated":"2026-06-26T03:29:48Z","snapshot_observed_at":"2026-08-13T03:29:01.911415Z","submitted_at":"2026-06-26T03:29:48Z","title":"Intuition-Guided Latent Reasoning for LLM-Based Recommendation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-29T03:46:05.076346Z"},"links":{"cited_paper":"/paper/2506.19235","citing_paper":"/paper/2606.27684"},"observation_digest":"sha256:7879b65ebc31f28e090d9a7327108748865e3b8f1c56968feabc8fd831e8bb71","observation_id":"9ca45276-c3f9-447a-b9eb-192a5ea914a9","resolution":{"observed_at":"2026-07-01T17:25:51.273725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19235","snapshot_observed_at":"2026-07-31T15:16:36.284072Z","title":"RecLLM-R1: A two-stage training paradigm with reinforcement learning and chain-of-thought.arXiv preprint arXiv:2506.19235,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.284072Z"},"links":{"cited_paper":"/paper/2506.19235","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:ceb535a0f28b91ec7f1bae5a6d20559cf6ec62811fbd49bea9f3e215fe59928f","observation_id":"256a2bc7-e757-49fd-98e6-8408da8096ee","resolution":{"observed_at":"2026-07-31T15:16:36.284072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.19235/citation-record","integrity":"/paper/2506.19235/integrity","json":"/paper/2506.19235/citation-record.json","paper":"/paper/2506.19235"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:12:30.692673Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:30.692673Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:3a1719c6db92dc7f223612e3b1418bb6a6bce5d75ddd74c36999bb090d033227","observation_id":"97ae766d-9af7-486d-8c84-23a3e1a74090","resolution":{"observed_at":"2026-08-06T23:12:30.692673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:30.725331Z","title":"Reinforcement learning based recommender systems: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:30.725331Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:b1017f4c86479b6a7033d75c05eeb59bec14081f4aff6faa481d9050975a8f3e","observation_id":"34b0f6be-4581-4066-aff6-85c6a3977597","resolution":{"observed_at":"2026-08-06T23:12:30.725331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:30.805607Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:30.805607Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:3962332f763f3ab97939bc1e28a1fcb63033df938466b93ba814d80542ee894d","observation_id":"130a9e2c-3b63-4d38-9bf0-4fa19e436d94","resolution":{"observed_at":"2026-08-06T23:12:30.805607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:35.619873Z","title":"Twin: Two-stage interest network for lifelong user behavior modeling in ctr prediction at kuaishou","venue":null,"work_id":"d85315e0-8972-4893-b432-b0239e6c6b04","year":2023},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:30.883121Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:3749f7fda55659fc4aaa8ba9fc80b0dd7c8e9b66d095e6f1fc0160951bccad14","observation_id":"e760fceb-6a17-4112-99ae-838258a2de64","resolution":{"observed_at":"2026-08-06T23:12:35.662028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:35.470921Z","title":"Wide & deep learning for recommender systems","venue":null,"work_id":"321735b6-3cb1-40d6-b220-6cb8ba37d27c","year":2016},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:30.968617Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:82bf1ab4969a708b69cac5f0e56126edaf693c6055e130c4a885ee11a177daa6","observation_id":"eed36b7d-a357-4938-98a8-6bf3c507493d","resolution":{"observed_at":"2026-08-06T23:12:35.608732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:35.384973Z","title":"Deep neural networks for youtube recommenda- tions","venue":null,"work_id":"4b8d45c7-2f04-45e6-95d4-8813e13b7c88","year":2016},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:31.060338Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:bec624998ee8d076217145359b490b533da9677dfce64ce468e6e82d2d32379d","observation_id":"24ee761f-9be1-44eb-8546-972628a2ca31","resolution":{"observed_at":"2026-08-06T23:12:35.408453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:31.185452Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:31.185452Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:653687981a19588961182cbeed23b0ab11a23d8f1f6fb4c2af622348d8f13ec3","observation_id":"7a2d09e1-dc40-4535-8cb9-a20d9ac91fbd","resolution":{"observed_at":"2026-08-06T23:12:31.185452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:31.298128Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:31.298128Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:f48504200a61a6ee7b58ce04f6238af7afb26ca2c7301703e3ce737480a444b1","observation_id":"bc6abfcb-890a-4e8f-927e-4da5563e87b3","resolution":{"observed_at":"2026-08-06T23:12:31.298128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:12:31.465019Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:31.465019Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:7304aef4145b1be761f2a2429927028f9a6c8a7fe5a07703860e7e9b28832f1e","observation_id":"c42f9214-9bfe-4dbc-8201-f17b69056f76","resolution":{"observed_at":"2026-08-06T23:12:31.465019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.04247","last_updated":"2017-03-13T04:55:19Z","snapshot_observed_at":"2026-07-06T05:33:25.278531Z","submitted_at":"2017-03-13T04:55:19Z","title":"DeepFM: A Factorization-Machine based Neural Network for CTR Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.04247","snapshot_observed_at":"2026-08-06T23:12:31.633989Z","title":"Deepfm: a factorization-machine based neural network for ctr prediction.arXiv preprint arXiv:1703.04247, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:31.633989Z"},"links":{"cited_paper":"/paper/1703.04247","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:819f421e894fe53b1c163618c7d0bd9a2a304f8509a605d2bab183c09b89b1ec","observation_id":"28801878-da4f-4c7c-8d31-ec04558d3def","resolution":{"observed_at":"2026-08-06T23:12:31.633989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:31.742209Z","title":"Ups and downs: Modeling the visual evolution of fashion trends with one-class collaborative filtering","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:31.742209Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:9326c015e56b0af27a052eec749cfb4b5b049d398e17b77f71c9604909807a51","observation_id":"c2c7126d-f7b1-45eb-ae0a-6b06c28c8506","resolution":{"observed_at":"2026-08-06T23:12:31.742209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:31.831740Z","title":"Neural collaborative filtering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:31.831740Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:84c934aa909173e579d8bfd7ca079bb11b08ef5b679359b93e5dd48a68ba2bcf","observation_id":"ea9f42bd-c89a-4cf1-b46f-25804ee9904f","resolution":{"observed_at":"2026-08-06T23:12:31.831740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06939","last_updated":"2016-03-29T14:52:58Z","snapshot_observed_at":"2026-07-31T19:00:00.136727Z","submitted_at":"2015-11-21T23:42:59Z","title":"Session-based Recommendations with Recurrent Neural Networks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06939","snapshot_observed_at":"2026-08-06T23:12:31.924775Z","title":"Session-based recommendations with recurrent neural networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:31.924775Z"},"links":{"cited_paper":"/paper/1511.06939","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:d11ba79adc279ec0c87458962d4ccdb13369f815f02a375276931878161ce8bf","observation_id":"5c2f5c2d-7d15-4d33-8493-b03ab0e29e96","resolution":{"observed_at":"2026-08-06T23:12:31.924775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06176","last_updated":"2023-10-09T21:58:55Z","snapshot_observed_at":"2026-08-13T05:53:29.599629Z","submitted_at":"2023-10-09T21:58:55Z","title":"Factual and Personalized Recommendations using Language Models and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06176","snapshot_observed_at":"2026-08-06T23:12:32.008803Z","title":"Factual and personalized recommendations using language models and reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.008803Z"},"links":{"cited_paper":"/paper/2310.06176","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:e56f8db68023ad924f7a0f6146b73797d54bdd1685e57f629af529af572631cd","observation_id":"5b11b211-b806-45c7-a53d-dc24d565891f","resolution":{"observed_at":"2026-08-06T23:12:32.008803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:35.228953Z","title":"Genrec: Large language model for generative recommendation","venue":null,"work_id":"d8e91290-fc0a-4bf9-96dd-28d5dd984339","year":2024},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.075922Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:ffabbd7bf2fbec2b949cd3fc26a9be8aa311d2d96af3d061a862108461f8f20a","observation_id":"7e9e8c6e-888d-46b0-ae30-8a298d9a3f66","resolution":{"observed_at":"2026-08-06T23:12:35.268155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:32.145328Z","title":"Self-attentive sequential recommendation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.145328Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:6da47ab37c4c7c4c6672cbb35748850125ce14a775c52ef4ff39dcc47bc91295","observation_id":"9f4f6a9e-d85c-4ac2-b6ca-0cb54f9f9c80","resolution":{"observed_at":"2026-08-06T23:12:32.145328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:32.213858Z","title":"Matrix factorization techniques for recom- mender systems","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.213858Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:090c9682f66f3053498feeea0fe798479a83b99caf5f9b91528b5cf4544d9fd2","observation_id":"378042bc-9a5b-426e-ad55-61dc63f23aad","resolution":{"observed_at":"2026-08-06T23:12:32.213858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03879","last_updated":"2023-04-08T00:30:08Z","snapshot_observed_at":"2026-08-13T12:07:10.550898Z","submitted_at":"2023-04-08T00:30:08Z","title":"GPT4Rec: A Generative Framework for Personalized Recommendation and User Interests Interpretation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03879","snapshot_observed_at":"2026-08-06T23:12:32.288506Z","title":"Gpt4rec: A generative framework for personalized recommendation and user interests interpretation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.288506Z"},"links":{"cited_paper":"/paper/2304.03879","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:a845a5ae0b229cb8ec930dfaabba183acdad3cdea18295573f0a9c323579308c","observation_id":"3898939a-803c-4bef-b330-1e6d4fa7d26b","resolution":{"observed_at":"2026-08-06T23:12:32.288506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:35.130506Z","title":"Llara: Large language-recommendation assistant","venue":null,"work_id":"397f152e-3bf0-4e2a-9c61-7b1d2398a23f","year":2024},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.369158Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:3aa17e9fd0eb176943eda4c16d0e1808aee331141d2ba03b8a4d611c896f26da","observation_id":"9daa28f9-c4e3-4621-b328-396bd34e7994","resolution":{"observed_at":"2026-08-06T23:12:35.153438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:35.045907Z","title":"Cascade ranking for operational e-commerce search","venue":null,"work_id":"c3ddf263-5812-48a2-a881-2d95e6ad51f2","year":2017},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.461444Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:337f5279174a0af8b3fb0aaed5fd48901da5bb7f29fd71f1757b84848d39cdbe","observation_id":"ef15a54c-ffdd-406b-b832-fa79fd60956a","resolution":{"observed_at":"2026-08-06T23:12:35.087673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:32.519992Z","title":"Integrating large language models into recommendation via mutual augmentation and adaptive aggregation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.519992Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:63d190b59218963a412f24b90242ff6b5635035a60d5b71f7713be8319d60b54","observation_id":"ffb7c52d-7b33-4c9f-a3e8-666fd7c90c46","resolution":{"observed_at":"2026-08-06T23:12:32.519992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:32.644503Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.644503Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:7b42aa339a78cf06429787b27625774e7e5e26c7b76913d932bf65a78d895761","observation_id":"f047dc14-655c-4a39-ac5f-a4da5245144b","resolution":{"observed_at":"2026-08-06T23:12:32.644503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:32.713350Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.713350Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:c2ccfbe27d99aa1388ad33f21041f36c9e719604ba4e850fb288f9591fcf3d63","observation_id":"5d034671-8f2e-45a7-81f1-49609fe7a2db","resolution":{"observed_at":"2026-08-06T23:12:32.713350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:34.944667Z","title":"Large language model based long-tail query rewriting in taobao search","venue":null,"work_id":"9626d63f-1429-4b40-a378-dc022d89ca51","year":2024},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.792471Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:c87442cda6294e72fb14a24b47358b663b7147baabb32a65a592c7a692a23fde","observation_id":"fdef5190-5935-4a90-a143-b96c92849146","resolution":{"observed_at":"2026-08-06T23:12:34.967595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:34.896220Z","title":"Rankflow: Joint optimization of multi-stage cascade ranking systems as flows","venue":null,"work_id":"d41c7cde-f41e-4a8d-87c8-6d7d1bcc238c","year":2022},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.865754Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:d57d2bec3a8acc0aac64e0868ae444ed285eaa37f809e46b5d94d499801be62b","observation_id":"057d0cc7-415f-4deb-83d2-6910b71dc400","resolution":{"observed_at":"2026-08-06T23:12:34.937120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:32.938700Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:32.938700Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:b7ee608171e4b70328268865c4134b3c90c6f7021030e9943271179d194a3a46","observation_id":"e4ad6fc9-d1e7-44a4-9888-a0ac34df5051","resolution":{"observed_at":"2026-08-06T23:12:32.938700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:33.010097Z","title":"Recommender systems with generative retrieval","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.010097Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:0758b5ed72da4fcf4d066fe2f73be44dd6311046db714b65c74d5e2a3d491088","observation_id":"9dbbb977-4b79-4568-8da1-7b7093d4630f","resolution":{"observed_at":"2026-08-06T23:12:33.010097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T23:12:33.093052Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.093052Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:9eca9b789895cf259a7a2e49af08cfa49bab6ec3d7116d6ef5df8a064390e59d","observation_id":"b9f09756-f522-4026-be76-82782b589466","resolution":{"observed_at":"2026-08-06T23:12:33.093052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T23:12:33.171005Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.171005Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:fe3dae97ef70e2cfbded202f2d1c5a02d9de6a835fe65dd43e7b3d6cca4eddad","observation_id":"3789c514-58a4-4d09-91aa-d06644610368","resolution":{"observed_at":"2026-08-06T23:12:33.171005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-06T23:12:33.229167Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.229167Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:9b0d374ce9ddcff89570a7e055210286e308877ffa7cbc84b81366be0a74152d","observation_id":"6d76c055-c758-4975-b431-e0b0da8ffbc5","resolution":{"observed_at":"2026-08-06T23:12:33.229167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:33.308287Z","title":"Learning to summarize with human feedback","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.308287Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:6b001e273c3b165e135b91468512a0d67c9480c102fec059704a24e2f46c19df","observation_id":"9f5341ee-59b9-4769-b59f-56cbbad49b78","resolution":{"observed_at":"2026-08-06T23:12:33.308287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:34.783451Z","title":"Bert4rec: Sequential recommendation with bidirectional encoder representations from transformer","venue":null,"work_id":"ef483b95-dca0-4bcd-b306-156d499d53ee","year":2019},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.359428Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:d7f1b27d5c3619c6fd91352e31eed66826cc96c6bf86eb2aa6a8c3365f9a188c","observation_id":"4e3bc0a5-59c6-44f5-97d9-3cc99f7c03ef","resolution":{"observed_at":"2026-08-06T23:12:34.807458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T23:12:33.416496Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.416496Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:af5d36754793ce2feee0b4456122fe095f3e242307cbfa77abd3112c189c2720","observation_id":"2c78550a-e9ff-452b-bcbf-efc5fc1b878f","resolution":{"observed_at":"2026-08-06T23:12:33.416496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:34.451444Z","title":"Kerl: A knowledge-guided reinforcement learning model for sequential recommendation","venue":null,"work_id":"45dfc1b2-83fc-4b77-a696-838cd4c9c606","year":2020},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.538034Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:73000ff03411bf58d007e4a807cc0d1312136bf75d4e1131ceee300769c8945c","observation_id":"097aa803-1f42-4562-ab1e-f0891b819b15","resolution":{"observed_at":"2026-08-06T23:12:34.565605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:33.615151Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.615151Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:79a65d266b4cfe2835974089934bba1e6801f85efbbd1798396415f904eedeba","observation_id":"99a8b067-e3fc-4988-a874-df705a14f3f4","resolution":{"observed_at":"2026-08-06T23:12:33.615151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07622","last_updated":"2023-06-07T17:55:58Z","snapshot_observed_at":"2026-08-13T11:43:35.946781Z","submitted_at":"2023-05-12T17:21:33Z","title":"PALR: Personalization Aware LLMs for Recommendation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07622","snapshot_observed_at":"2026-08-06T23:12:33.694178Z","title":"Palr: Personalization aware llms for recommendation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.694178Z"},"links":{"cited_paper":"/paper/2305.07622","citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:1a5869287b4a2e7541ab23f1ba9f03799fe6fa6134b2ce8deeb281f07bd63fa9","observation_id":"6bd8d4bf-7194-45c8-b172-be0827d6c01a","resolution":{"observed_at":"2026-08-06T23:12:33.694178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:34.200669Z","title":"Feature-level deeper self-attention network for sequential recommendation","venue":null,"work_id":"d81d99ca-7bcf-4862-b210-a3f184a69ae4","year":2019},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.767884Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:0064ee82aa07f7ae846acca8ae3ad1a6759963700db9048cfdb658099cb1753a","observation_id":"481ac885-beb2-4f72-a162-7174c3a6be73","resolution":{"observed_at":"2026-08-06T23:12:34.300878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:33.831335Z","title":"Deep interest network for click-through rate prediction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.831335Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:8c57a88b0958d5251b07a1575fae10ed70bea588aac8340628c178c9a4a1843f","observation_id":"2cb6e1b4-a622-47e9-96fe-14893ee14302","resolution":{"observed_at":"2026-08-06T23:12:33.831335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:12:33.875901Z","title":"S3-rec: Self-supervised learning for sequential recommendation with mutual information maximization","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:33.875901Z"},"links":{"citing_paper":"/paper/2506.19235"},"observation_digest":"sha256:32e91812c66e481f5d34df2ca7036d7f4024e4267d8627fa0f98aae2cb3eb057","observation_id":"37362ac1-d24e-4014-b74e-2b2e02f3b96a","resolution":{"observed_at":"2026-08-06T23:12:33.875901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T14:59:11.482041Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 3 inbound Pith citation observations for arXiv:2506.19235."}