{"as_of":"2026-08-15T18:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2446dc1ea25f6324db5614c466742f4e8ec8112808aafcf24d5b52dbb29ff4c1","coverage":[{"denominator":9,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T08:14:02.691163Z","state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.18175/citation-record","integrity":"/paper/2601.18175/integrity","json":"/paper/2601.18175/citation-record.json","paper":"/paper/2601.18175"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-03T08:14:02.610152Z","title":"Touvron, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-09T12:19:31.761417Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.610152Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:9e8dd3622b52409e56b859ea67d05bd87bf1326f06e0b1b46603129ec3b6d4ed","observation_id":"09029daa-0b2c-4c2e-86cb-a3943bd44ca3","resolution":{"observed_at":"2026-08-03T08:14:02.610152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:14:02.691163Z","title":"The first equality is a definition of Lπ0 (π+)","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-09T12:19:31.761417Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.691163Z"},"links":{"citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:dcfa63d8293e5991f89d1d30e1a4ed8593ba9466c8489ad78c98ebc6044866bc","observation_id":"5c8376d4-1666-4d32-9355-6b519a11430a","resolution":{"observed_at":"2026-08-03T08:14:02.691163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:14:02.023064Z","title":"Bhandari and D","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-09T12:19:31.761417Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.023064Z"},"links":{"citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:1b9a92cfc3f5220f2d58d3ec78b4ab090e9f4e3da4d1f3f17e70c9207fcafa16","observation_id":"62f79463-8cd1-407f-86c7-4435e5607a42","resolution":{"observed_at":"2026-08-03T08:14:02.023064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-03T08:14:02.464290Z","title":"Schulman, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-09T12:19:31.761417Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.464290Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:1cc84bc2265fe9e9750b31f3baf953faf10bcd7f90736dfdd68baa0aa09ad89a","observation_id":"d529df4a-4268-4725-bf0c-dea6b014cf42","resolution":{"observed_at":"2026-08-03T08:14:02.464290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-03T08:14:02.544642Z","title":null,"venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-09T12:19:31.761417Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.544642Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:abaf0132b2103db6ee9380624c5999ba70335ab543c1fa4e07257cbb909cf281","observation_id":"310d9c01-bbdb-4460-8592-6e9a51c52323","resolution":{"observed_at":"2026-08-03T08:14:02.544642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T08:14:02.093983Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-09T12:19:31.761417Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.093983Z"},"links":{"citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:d273ddf4afa14c112ec51d2426a9aff133b43832e6e6574087e0232f4fc7f303","observation_id":"bcb313a7-679a-48e0-a15c-31d27690d890","resolution":{"observed_at":"2026-08-03T08:14:02.093983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00909","last_updated":"2018-05-20T20:03:59Z","snapshot_observed_at":"2026-08-08T20:31:18.897748Z","submitted_at":"2018-05-02T17:11:20Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00909","snapshot_observed_at":"2026-08-03T08:14:02.253123Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-09T12:19:31.761417Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.253123Z"},"links":{"cited_paper":"/paper/1805.00909","citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:8960e5404f849306861cd51ae32d09e6e41beecb1a6900de41817ae233a16099","observation_id":"b281e5ca-9f1b-4672-afe5-f200cffd2c3f","resolution":{"observed_at":"2026-08-03T08:14:02.253123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02875","last_updated":"2020-06-23T15:55:05Z","snapshot_observed_at":"2026-08-11T18:35:25.012343Z","submitted_at":"2019-12-05T21:10:08Z","title":"Reinforcement Learning Upside Down: Don't Predict Rewards -- Just Map Them to Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02875","snapshot_observed_at":"2026-08-03T08:14:02.352724Z","title":"Schmidhuber","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-09T12:19:31.761417Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.352724Z"},"links":{"cited_paper":"/paper/1912.02875","citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:26166dfafb16bef9f848255216e777235596a9f78e3f587c94ceb8983525cd3f","observation_id":"221a88ec-2bdf-4443-ac4e-ba250853f5da","resolution":{"observed_at":"2026-08-03T08:14:02.352724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-03T08:14:02.173867Z","title":"Grattafiori, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","snapshot_observed_at":"2026-08-09T12:19:31.761417Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T08:14:02.173867Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2601.18175"},"observation_digest":"sha256:dc2064280a4761cdaeac2f34c95e032404d157f1148bdbe069863278a0b3a0c7","observation_id":"58bcb1bc-0d35-4f65-8783-f27f9934e8e3","resolution":{"observed_at":"2026-08-03T08:14:02.173867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.18175","last_updated":"2026-06-02T19:09:34Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T12:19:31.761417Z","submitted_at":"2026-01-26T05:54:39Z","title":"Success Conditioning as Policy Improvement: The Optimization Problem Solved by Imitating Success"},"reference_resolution":{"displayed":9,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":9},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 9 of 9 outbound references and 0 inbound Pith citation observations for arXiv:2601.18175."}