{"as_of":"2026-08-24T02:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:20ff594fedc3ae2d107f60e409da51ceb072da6b0120805a53ac56f77cad5532","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T21:06:30.259347Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T14:03:01.974171Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-16T09:30:44.150369Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"cited_work":{"arxiv_id":"2511.16886","doi":"10.48550/arxiv.2511.16886","metadata_source":"pith","pith_arxiv_id":"2511.16886","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","venue":"cs.CL","work_id":"973d1be6-6c2d-494b-8330-e037238431fe","year":2025},"citing_paper":{"arxiv_id":"2604.02029","last_updated":"2026-06-05T06:21:20Z","snapshot_observed_at":"2026-07-30T23:04:23.206455Z","submitted_at":"2026-04-02T13:36:37Z","title":"The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T14:03:01.974171Z"},"links":{"cited_paper":"/paper/2511.16886","citing_paper":"/paper/2604.02029"},"observation_digest":"sha256:586aacd175091d64316ce17d31e774717f99f963a4cb9e6a7e4570443760921d","observation_id":"fa662205-7a44-4221-88c9-4e704fca57ba","resolution":{"observed_at":"2026-07-13T14:09:38.535527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2511.16886/citation-record","integrity":"/paper/2511.16886/integrity","json":"/paper/2511.16886/citation-record.json","paper":"/paper/2511.16886"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1807.03819","last_updated":"2019-03-05T16:46:19Z","snapshot_observed_at":"2026-08-13T07:34:17.550838Z","submitted_at":"2018-07-10T18:39:15Z","title":"Universal Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03819","snapshot_observed_at":"2026-08-03T21:06:29.296424Z","title":"Universal transformers.arXiv preprint arXiv:1807.03819,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-16T09:30:44.150369Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:29.296424Z"},"links":{"cited_paper":"/paper/1807.03819","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:5f0b64fe0543ac84e5dc5ec648ebfbb6aab5dbb88776ea77bb29357cd64f5608","observation_id":"ff9e43c3-9687-454e-ae99-7924ad2edec2","resolution":{"observed_at":"2026-08-03T21:06:29.296424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-03T21:06:29.717017Z","title":"and Salimans, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-16T09:30:44.150369Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:29.717017Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:69c6e839197ee42260d05fc0b0cb8d5a0de0c554f006a630709d6a1a6dc03181","observation_id":"faa93361-0335-4d8e-aeb3-ccb0b08bc471","resolution":{"observed_at":"2026-08-03T21:06:29.717017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07141","last_updated":"2023-05-11T21:06:39Z","snapshot_observed_at":"2026-08-21T18:29:31.370037Z","submitted_at":"2023-05-11T21:06:39Z","title":"The ConceptARC Benchmark: Evaluating Understanding and Generalization in the ARC Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07141","snapshot_observed_at":"2026-08-03T21:06:30.009675Z","title":"Oarga, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-16T09:30:44.150369Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:30.009675Z"},"links":{"cited_paper":"/paper/2305.07141","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:a85674dd594dac27394fac35ca07d7e4691c9fe9b7d38bc6fcb6fea51ca4ca9b","observation_id":"d9965a2c-7799-4554-9e43-271b2abce97e","resolution":{"observed_at":"2026-08-03T21:06:30.009675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12424","last_updated":"2024-03-16T21:10:38Z","snapshot_observed_at":"2026-08-16T14:41:35.235110Z","submitted_at":"2023-11-21T08:32:38Z","title":"Looped Transformers are Better at Learning Learning Algorithms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12424","snapshot_observed_at":"2026-08-03T21:06:30.161963Z","title":"Looped transformers are better at learning learning al- gorithms.arXiv preprint arXiv:2311.12424,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-16T09:30:44.150369Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:30.161963Z"},"links":{"cited_paper":"/paper/2311.12424","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:57003a5478d574dbbd3951de5e50063d04fbab632d6371d6ab2b9f1ffed75887","observation_id":"f05a28e1-9b46-4a09-90ea-5f15886d9229","resolution":{"observed_at":"2026-08-03T21:06:30.161963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T21:06:30.259347Z","title":"Alternative Improvement Generators.As described in §4.2, there are several viable methods to generate intermediate steps","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-16T09:30:44.150369Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:30.259347Z"},"links":{"citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:b6e3f69534e726c543c143a048fff1384613183f940ddf6607268a237013cecc","observation_id":"fd0c9e37-1de4-447d-8634-215537f7b208","resolution":{"observed_at":"2026-08-03T21:06:30.259347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21734","last_updated":"2025-08-04T08:45:08Z","snapshot_observed_at":"2026-08-21T00:19:04.881415Z","submitted_at":"2025-06-26T19:39:54Z","title":"Hierarchical Reasoning Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21734","snapshot_observed_at":"2026-08-03T21:06:30.093930Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-16T09:30:44.150369Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:30.093930Z"},"links":{"cited_paper":"/paper/2506.21734","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:482fe611f440174b884cf8b95a56a8a99fc6d2ead673b2b028eaa28d87bf0278","observation_id":"21bcbd0d-a95d-42de-9a24-1c41b8f413f4","resolution":{"observed_at":"2026-08-03T21:06:30.093930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-20T13:32:55.916408Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-03T21:06:29.597655Z","title":"Dream to control: Learning behaviors by latent imagination.arXiv preprint arXiv:1912.01603,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-16T09:30:44.150369Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:29.597655Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:7e5e7ab57e0ef81e6c347eacab3b97813a5b51b64dbeec2c65eab119dc6b7d8a","observation_id":"22b9ddee-1aa1-49cd-a886-ee384d2d7b4a","resolution":{"observed_at":"2026-08-03T21:06:29.597655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23458","last_updated":"2025-05-29T14:06:50Z","snapshot_observed_at":"2026-08-21T04:28:08.666883Z","submitted_at":"2025-05-29T14:06:50Z","title":"Diffusion Guidance Is a Controllable Policy Improvement Operator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23458","snapshot_observed_at":"2026-08-03T21:06:29.374560Z","title":"Diffusion guidance is a controllable policy improvement operator","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-16T09:30:44.150369Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:29.374560Z"},"links":{"cited_paper":"/paper/2505.23458","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:a4f2b9e6e755852b8e10060eca742a8d7e6dd46799b4f89bfc1025062f716641","observation_id":"21705f32-f9ce-49ff-a85b-0490e878683c","resolution":{"observed_at":"2026-08-03T21:06:29.374560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01547","last_updated":"2019-11-25T13:02:04Z","snapshot_observed_at":"2026-08-17T05:38:14.090895Z","submitted_at":"2019-11-05T00:31:38Z","title":"On the Measure of Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01547","snapshot_observed_at":"2026-08-03T21:06:29.227914Z","title":"On the measure of intelligence.arXiv preprint arXiv:1911.01547,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-16T09:30:44.150369Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:29.227914Z"},"links":{"cited_paper":"/paper/1911.01547","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:ea5e336662b115d9a80b7837206f1e90fc714c9af3640c3714f9df14cee60c1e","observation_id":"4f18f9f3-50c1-426c-954e-c5937e77cede","resolution":{"observed_at":"2026-08-03T21:06:29.227914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04871","last_updated":"2025-10-06T14:58:08Z","snapshot_observed_at":"2026-08-17T11:15:52.067219Z","submitted_at":"2025-10-06T14:58:08Z","title":"Less is More: Recursive Reasoning with Tiny Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04871","snapshot_observed_at":"2026-08-03T21:06:29.803009Z","title":"Less is more: Recursive reasoning with tiny networks.arXiv preprint arXiv:2510.04871,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-16T09:30:44.150369Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:29.803009Z"},"links":{"cited_paper":"/paper/2510.04871","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:1a39509bde4d38fc66b176e18056cd0c7e767a1f0a862a99d6fc0638e0d99853","observation_id":"883b64f5-5f91-4300-9ae1-1a2d68106f17","resolution":{"observed_at":"2026-08-03T21:06:29.803009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.08983","last_updated":"2017-02-21T16:21:21Z","snapshot_observed_at":"2026-08-19T09:41:48.169666Z","submitted_at":"2016-03-29T22:09:00Z","title":"Adaptive Computation Time for Recurrent Neural Networks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.08983","snapshot_observed_at":"2026-08-03T21:06:29.486681Z","title":"Adaptive computation time for recurrent neural networks.arXiv preprint arXiv:1603.08983,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-16T09:30:44.150369Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:29.486681Z"},"links":{"cited_paper":"/paper/1603.08983","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:0d939185f583f7aba54a79a410df6dd61be6b61afcb1bbe0959c439bf8f90291","observation_id":"53302236-baab-4592-86ae-5d7e6e2ac11a","resolution":{"observed_at":"2026-08-03T21:06:29.486681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16834","last_updated":"2024-06-06T21:06:44Z","snapshot_observed_at":"2026-08-14T20:57:18.809821Z","submitted_at":"2023-10-25T17:59:12Z","title":"Discrete Diffusion Modeling by Estimating the Ratios of the Data Distribution","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16834","snapshot_observed_at":"2026-08-03T21:06:29.881012Z","title":"Discrete diffusion model- ing by estimating the ratios of the data distribution.arXiv preprint arXiv:2310.16834,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","snapshot_observed_at":"2026-08-16T09:30:44.150369Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator","version":5},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T21:06:29.881012Z"},"links":{"cited_paper":"/paper/2310.16834","citing_paper":"/paper/2511.16886"},"observation_digest":"sha256:46ae45aa7b5db6a8d85af90b5df0d46122a78a6897e71f1b8118a3cafda49ad3","observation_id":"f10b11f9-6161-40e2-b920-75d1698c4166","resolution":{"observed_at":"2026-08-03T21:06:29.881012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.16886","last_updated":"2026-05-30T04:11:13Z","latest_version":5,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T09:30:44.150369Z","submitted_at":"2025-11-21T01:54:23Z","title":"Latent Reasoning in TRMs is Secretly a Policy Improvement Operator"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 1 inbound Pith citation observation for arXiv:2511.16886."}