Pith. sign in

Paper Citation Record · LEDGER

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future

As of 21 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2508.06026.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.06026 v1

Coverage vector

measured 45 of 45 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T23:06:49.755721Z

measured 46 of 46 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-21T06:32:19.484+00:00

measured 1 of 1 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-05-10T13:58:53.430492Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-05-10T14:00:28.509134Z

Reference resolution

45 of 45 outbound references displayed

  • verified exact4
  • verified fuzzy4
  • unresolved37
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 6e2097c0-2f18-4025-83f8-884c8e571991 · outbound

This paper cites Y.; Rajbhandari, S.; Awan, A.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Y.; Rajbhandari, S.; Awan, A

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:06:50.761472Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.265162Z digest=sha256:999b479017ff766b4661bc7dbc690e126c68c1d480d67509e8a502eaaab0a595

Observation 3acfe968-e085-46da-a75d-1714196f7471 · outbound

This paper cites PaLM 2 Technical Report.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future PaLM 2 Technical Report

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.384616Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.384616Z digest=sha256:6d9ba2f8073c07827d2b8316a6a9247432a7e3236e274111846d1d775cf36d47

Observation 5fee6bf4-7908-49a4-9541-4fcfcb5529af · outbound

This paper cites Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.499308Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.499308Z digest=sha256:f0d8f0c71904d54402d01a8758eba625a326cd0e14b4bd3762e2eae34f0eb91e

Observation bbfa7b49-95de-4eed-9f27-e478b0537b14 · outbound

This paper cites D.; Dhariwal, P.; Neelakantan, A.; Shyam, P.; Sastry, G.; Askell, A.; et al.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future D.; Dhariwal, P.; Neelakantan, A.; Shyam, P.; Sastry, G.; Askell, A.; et al

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.550152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.550152Z digest=sha256:7db9efb417f8ae25658cbdd907ff2f0a45054c883cd41aa703a70d349900f7ed

Observation d71f2658-3540-4f16-be15-29d0564b1ef0 · outbound

This paper cites Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.556074Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.556074Z digest=sha256:e22b5dd701dbe95120c3ec3f291fefa7c5a1ab5fe03acbb8909c0e30633051c9

Observation c3546670-28f0-428a-a813-b2636864ef32 · outbound

This paper cites PaLM: Scaling Language Modeling with Pathways.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future PaLM: Scaling Language Modeling with Pathways

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.561919Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.561919Z digest=sha256:b8a6d142fd6550d74e635930a756cb44b7eaadb5a2c2ebc1df45d15ccb261c42

Observation 17403456-8f5d-45bb-b58a-84c21c0c5e2d · outbound

This paper cites UltraFeedback: Boosting Language Models with Scaled AI Feedback.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future UltraFeedback: Boosting Language Models with Scaled AI Feedback

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.568769Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.568769Z digest=sha256:763746c0703f4a52b7a71c9fb8ca0e43df169b69d32689c6fd7a4f26a673670c

Observation 999e88b1-31ff-4cfb-a966-595b267ba0bc · outbound

This paper cites D.; and Chatzoglou, P.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future D.; and Chatzoglou, P

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:06:50.729693Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.574803Z digest=sha256:841db88e5776b2c34b55ec48f6f1cdc849a161ff6843ca72441a3a22cc67bff0

Observation c99e57b6-dc00-4d09-b4a1-c0c4d0d6ae38 · outbound

This paper cites Self-Improvement in Language Models: The Sharpening Mechanism.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Self-Improvement in Language Models: The Sharpening Mechanism

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.580054Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.580054Z digest=sha256:08f6c2da8f8b47fef86beb475da9e6e5553f072f942f596f7f22180ba09bd3b0

Observation a32b81c5-329a-439f-92a4-83d5b77c13e4 · outbound

This paper cites Large Language Models Can Self-Improve.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Large Language Models Can Self-Improve

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.586132Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.586132Z digest=sha256:8c10957bb622ce96995b6c9bc155e56bb9b767a02052a35ad07cbc1e611ca339

Observation 4f747ef8-1b49-4793-a342-84c2e7d649cb · outbound

This paper cites Mistral 7B.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Mistral 7B

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.591455Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.591455Z digest=sha256:ba6016261c74c9a2d09ae1b05ea00c8bf9769e77dcb453f97c594f409d8ca5c2

Observation 31ba34a6-ad6a-4d61-9c6c-372f29c13ac3 · outbound

This paper cites Understanding the Effects of RLHF on LLM Generalisation and Diversity.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Understanding the Effects of RLHF on LLM Generalisation and Diversity

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.596674Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.596674Z digest=sha256:125d9df8f8eb6819b4c8794d6beb9e1ff124a3157223d6e823008b36295f491f

Observation 66377ed1-f64a-4ec4-8053-682d072536f6 · outbound

This paper cites o pf, A.; Kilcher, Y.; Von R \.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future o pf, A.; Kilcher, Y.; Von R \

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:06:50.713051Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.601469Z digest=sha256:3c5000930359db234b63c7181bdab797490ceba7ea81f86def7820a7c0c4d878

Observation 292e2e37-2247-4dfa-a57e-561bb553f050 · outbound

This paper cites H.; Gonzalez, J.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future H.; Gonzalez, J

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T23:06:50.697208Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.606111Z digest=sha256:0b35499183def0a072d6cb62b02d061607405275158e287f6a49bb2d33454e06

Observation 8b83f706-b805-4cad-9357-506fc9a9a37f · outbound

This paper cites Diverse Preference Optimization.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Diverse Preference Optimization

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.610348Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.610348Z digest=sha256:cc76beaee2d91344b0fc2442e188dcb56b1e5fdb70cae84e2414120629b9015c

Observation a12c86bd-478d-4814-947b-c2d2814803e3 · outbound

This paper cites Generative Judge for Evaluating Alignment.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Generative Judge for Evaluating Alignment

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.615131Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.615131Z digest=sha256:2f4e4c1ff4916dd11f1ec6f2fb0cd221b3beb235f3bc063bcaf9aa3ee97174d4

Observation 2e30402c-ed2e-40f9-9e2c-01d45a429b1c · outbound

This paper cites From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.619937Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.619937Z digest=sha256:4706549eafbd21fe64347345c8e13ebbaf960d820bc580eb9a0bd15dceefef99

Observation 57b48448-a52a-4f71-b12e-4937390791ac · outbound

This paper cites Self-Alignment with Instruction Backtranslation.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Self-Alignment with Instruction Backtranslation

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.624787Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.624787Z digest=sha256:ac9515e80613a43e0264ba8c6c4ab4572aa2c1b9d60cc94b39afca2b9358c368

Observation 9ef6c809-ae6b-413c-b9af-9d701bc46b00 · outbound

This paper cites an unresolved cited work.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Unresolved cited work

Reference 19

Resolution
unresolved
raw_fallback, observed 2026-08-05T23:06:50.680334Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.630133Z digest=sha256:ee8e891ddd6e37c10aac31496475c763489007e6e45251e5242e3fd415b612b1

Observation 27ce3375-f590-421a-ae23-8a0be3fc2df3 · outbound

This paper cites Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Test-Time Preference Optimization: On-the-Fly Alignment via Iterative Textual Feedback

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.634866Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.634866Z digest=sha256:70630d89870f28aa5a1e18a3314abbbf51763b0219b66d660e3f1d964bcdb52e

Observation ac02ce60-fad8-4221-a813-a20db1a9a42d · outbound

This paper cites From Drafts to Answers: Unlocking LLM Potential via Aggregation Fine-Tuning.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future From Drafts to Answers: Unlocking LLM Potential via Aggregation Fine-Tuning

Reference 21

Resolution
verified exact
local_arxiv, observed 2026-08-05T23:06:50.259087Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.639546Z digest=sha256:0ac984fa0bffd24ae9f299958c8bdf6976a7a3ee97d98497c5340ab0469fd6db

Observation 092382b6-2b8c-42d5-9650-e3796259d9ac · outbound

This paper cites Statistical Rejection Sampling Improves Preference Optimization.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Statistical Rejection Sampling Improves Preference Optimization

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.645169Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.645169Z digest=sha256:6770f5d8bff94dbd771cf7a39dde38f38721685035de5dd266b368e78eceab16

Observation 8d08cd5a-6a5d-4a26-b6d3-1e817c31283b · outbound

This paper cites an unresolved cited work.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Unresolved cited work

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.649837Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.649837Z digest=sha256:4f88984b31db7674559b18a3d74423b181d205defba3bc5b76ba33996c8131f0

Observation 27153f03-a1cb-4a4b-aeea-4333db13b026 · outbound

This paper cites an unresolved cited work.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Unresolved cited work

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.654847Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.654847Z digest=sha256:e4a11a12406d75bd73d8f65dc5c91fe5702227ad46e8bfcc1f7711d2dd05aa8b

Observation 4a4b7da3-019c-4df1-8e25-37eb52b1eecd · outbound

This paper cites an unresolved cited work.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Unresolved cited work

Reference 25

Resolution
unresolved
raw_fallback, observed 2026-08-05T23:06:50.641870Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.659754Z digest=sha256:0f6b9af8f7a6d25ce13023c1fa554fe7d6785c9025fdd393624edaf3469d6bdc

Observation c7bb6c53-4d80-4d3f-9489-cb20d2990fa9 · outbound

This paper cites D.; Ermon, S.; and Finn, C.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future D.; Ermon, S.; and Finn, C

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.665152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.665152Z digest=sha256:4328cbc5dd23177bce9874d7fefc83b8358706b8a9c1b3feda45edf0bfae4116

Observation 972df6f0-fd7c-42db-bcdb-8dd0c67eac67 · outbound

This paper cites D.; and Arora, S.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future D.; and Arora, S

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.669976Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.669976Z digest=sha256:3c212c2f5cc6fdf2f1fa5a0a6ecc3979d7a7456e5ee57bb8f8cfea17a6de685b

Observation cef979ca-8cf6-4927-9d87-3c4045b782f1 · outbound

This paper cites an unresolved cited work.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Unresolved cited work

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.674585Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.674585Z digest=sha256:eab3781d6706adb5feeba1d1c0c3fc3d8a11bcd904500016dc59224408543ad8

Observation 1dd4722a-e41b-4475-af7e-ca396a61768c · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future LLaMA: Open and Efficient Foundation Language Models

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.678965Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.678965Z digest=sha256:08bad0ef9aa434b9a41eb9be8bbba1668b6eed35e035424e116b4ec0cf946c7e

Observation ca0106e4-d14d-464d-8503-afc5bcdd59eb · outbound

This paper cites an unresolved cited work.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Unresolved cited work

Reference 30

Resolution
unresolved
raw_fallback, observed 2026-08-05T23:06:50.600958Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.683965Z digest=sha256:a0fb4f846432922d7b6e78cf392fb6dc6c8c1c50f3bb97a4ccda2ac82f0d5a5d

Observation 19a68efa-94f5-40ea-a1fb-beae266ab74a · outbound

This paper cites CREAM: Consistency Regularized Self-Rewarding Language Models.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future CREAM: Consistency Regularized Self-Rewarding Language Models

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.688537Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.688537Z digest=sha256:3340a2af14ab8ef80b473e8c931815023decad41dfeb6611c3a0f8b426e2b993

Observation e60045f1-012f-4a39-93aa-e7081a442b2c · outbound

This paper cites Enabling Language Models to Implicitly Learn Self-Improvement.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Enabling Language Models to Implicitly Learn Self-Improvement

Reference 32

Resolution
verified exact
local_arxiv, observed 2026-08-05T23:06:50.013159Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.693409Z digest=sha256:5f0b940a15930002cd619696ab4e0e08d7f232f6a2baf682e6ce0294d423cf8a

Observation 71b2bf67-f471-482f-ba00-5427082fa2ee · outbound

This paper cites Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Meta-Rewarding Language Models: Self-Improving Alignment with LLM-as-a-Meta-Judge

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.698152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.698152Z digest=sha256:4d06bdc5a07ae47039996d3f58da7d193d82ae16f156c34e1d0abaa574b64b14

Observation 2dbbf387-75a1-4980-98ba-75c7278a89f1 · outbound

This paper cites Qwen2.5 Technical Report.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Qwen2.5 Technical Report

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.702813Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.702813Z digest=sha256:21bc12bcb2bd5679f58cac5835669567cab8fa0560e9c113e4be32384005ef2f

Observation 5f206878-43d7-44dd-b0a8-1b6e50f83983 · outbound

This paper cites Teaching Language Models to Self-Improve through Interactive Demonstrations.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Teaching Language Models to Self-Improve through Interactive Demonstrations

Reference 35

Resolution
verified exact
local_arxiv, observed 2026-08-05T23:06:49.952745Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.707883Z digest=sha256:2770356e530cb90e225ffd92f0fb06349efd66c72a2bb62c385b46117dfd2f14

Observation 596f078d-45fb-46bf-a7ad-bcc89012defb · outbound

This paper cites Self-Rewarding Language Models.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Self-Rewarding Language Models

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.712423Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.712423Z digest=sha256:d287f4913719f77b74d0580ca91c917e6b19155168da5c410b54c3b018d87f2d

Observation 3111235b-0f77-4cf0-8a98-0f23c4a51f66 · outbound

This paper cites GLM-130B: An Open Bilingual Pre-trained Model.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future GLM-130B: An Open Bilingual Pre-trained Model

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.717415Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.717415Z digest=sha256:cbe0ec903c6034ec4f352b7a1b54e372350f00e385955d31138b4204039e200a

Observation a92bd15e-a55f-47c6-9899-d9fa0b7ae95a · outbound

This paper cites Direct Value Optimization: Improving Chain-of-Thought Reasoning in LLMs with Refined Values.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Direct Value Optimization: Improving Chain-of-Thought Reasoning in LLMs with Refined Values

Reference 38

Resolution
verified exact
local_arxiv, observed 2026-08-05T23:06:49.887791Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=arxiv_source observed=2026-08-05T23:06:49.722299Z digest=sha256:2473cece99a6a5ccbca7d7decbbd844583bf4aa3a0266d7941d1de8145aec5e1

Observation cefe01cc-2bf6-412e-9050-1c1a2d005fcc · outbound

This paper cites Process-based Self-Rewarding Language Models.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Process-based Self-Rewarding Language Models

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.727005Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.727005Z digest=sha256:5d686709621db75b61cb2b142c10b6e9da739a60cf901379b27743dc8146569a

Observation 15701eec-a68a-4602-bb80-7ceeb2824b31 · outbound

This paper cites Language Models are Universal Embedders.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Language Models are Universal Embedders

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.731775Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.731775Z digest=sha256:e0f563ff3038a60acd63be66ec4044959b73dd10926fb1c5aa129ca6eed79b99

Observation db368bf3-22c8-401f-b634-de41099e2368 · outbound

This paper cites Forcing Diffuse Distributions out of Language Models.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Forcing Diffuse Distributions out of Language Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.736635Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.736635Z digest=sha256:52072e33aa83f045f63038f3f6a299c4510a8b1086913a02b5d56fb1be707a93

Observation 2ee15eaf-15d6-45bf-9c0d-29fae194ec06 · outbound

This paper cites an unresolved cited work.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Unresolved cited work

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.741440Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.741440Z digest=sha256:97e5f1b011d36a13b2872e42a45bdfdee54183ba656800867aeb88db799f8a33

Observation 18db4afd-80b6-4da9-b0f4-c8e5b09750d9 · outbound

This paper cites Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future Self-Consistency of the Internal Reward Models Improves Self-Rewarding Language Models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.746071Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.746071Z digest=sha256:964d37baca10dcfdb41f067023f7e14cdb6ddc8f6667ee5294290a2846e661de

Observation eb64a4ed-7654-425f-94c7-47c635f5722a · outbound

This paper cites , " * write output.state after.block = add.period write newline.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future , " * write output.state after.block = add.period write newline

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.750641Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.750641Z digest=sha256:ae3f96cee1f3be2eeb6204aafbf99d733156f6fd5ef3e15e26e0d02931c44ecf

Observation 6f03bad6-0778-437a-8257-e1538fe59399 · outbound

This paper cites write newline.

Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future write newline

Reference 45

Resolution
unresolved
no resolver link, observed 2026-08-05T23:06:49.755721Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T23:06:49.755721Z digest=sha256:2d37425806ca401bb2c636b44e59c0635eefa945571d81b8f82e59e1fa71ef97

Pith citing papers

Observation be78f0cd-54ad-4ce9-9b6a-dfeb43182ab9 · inbound

Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges cites this paper.

Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future

Reference 165

Resolution
verified exact
arxiv_id, observed 2026-05-10T14:00:28.511587Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.

source=pdf_text observed=2026-05-10T13:58:53.430492Z digest=sha256:128129c7d12ef36a49d4c543f604fea1425ff34428de4aa42e07c23f6d8b7932