{"as_of":"2026-08-10T07:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8395d6a0bf3723a1229758e670611002b971c9db9cc0066c9ee11a46106e2b84","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:57:30.462207Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T20:56:13.461679Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","snapshot_observed_at":"2026-07-06T15:32:01.532477Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","version":1},"cited_work":{"arxiv_id":"2305.14483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14483","snapshot_observed_at":"2026-07-01T20:56:13.461679Z","title":"arXiv preprint arXiv:2305.14483 , year =","venue":null,"work_id":"5667354d-a9b6-4f08-acd3-b5df64947505","year":2023},"citing_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-16T09:34:04.394588Z"},"links":{"cited_paper":"/paper/2305.14483","citing_paper":"/paper/2403.07691"},"observation_digest":"sha256:076cbb1864ea71841922aa912b679d1139c170eb0343180d84a9b70fa9e65ca2","observation_id":"28bd4512-e841-440e-9f47-4f4374a6446d","resolution":{"observed_at":"2026-05-16T09:34:04.809974Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","snapshot_observed_at":"2026-07-06T15:32:01.532477Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14483","snapshot_observed_at":"2026-08-07T15:04:40.606818Z","title":"Advances in neural in- formation processing systems, 35:27730–27744","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16475","last_updated":"2025-05-22T10:03:05Z","snapshot_observed_at":"2026-08-07T21:58:45.356145Z","submitted_at":"2025-05-22T10:03:05Z","title":"ReflectEvo: Improving Meta Introspection of Small LLMs by Learning Self-Reflection","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T15:04:40.606818Z"},"links":{"cited_paper":"/paper/2305.14483","citing_paper":"/paper/2505.16475"},"observation_digest":"sha256:e6c783aea689037df2c52356d5c3bfeee22814df73e30e203e638886d6632a34","observation_id":"db0cbb67-4e25-44f8-8137-86ad2df344de","resolution":{"observed_at":"2026-08-07T15:04:40.606818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","snapshot_observed_at":"2026-07-06T15:32:01.532477Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","version":1},"cited_work":{"arxiv_id":"2305.14483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14483","snapshot_observed_at":"2026-07-01T20:56:13.461679Z","title":"arXiv preprint arXiv:2305.14483 , year =","venue":null,"work_id":"5667354d-a9b6-4f08-acd3-b5df64947505","year":2023},"citing_paper":{"arxiv_id":"2605.09395","last_updated":"2026-05-16T07:36:34Z","snapshot_observed_at":"2026-07-31T09:17:50.243143Z","submitted_at":"2026-05-10T07:47:09Z","title":"Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T04:40:23.895430Z"},"links":{"cited_paper":"/paper/2305.14483","citing_paper":"/paper/2605.09395"},"observation_digest":"sha256:85591fdc42fecc1d2f05bfea89214c611a7d139d429f9e5f076ffb069e0c52f0","observation_id":"146c8736-2eec-4e14-a68a-1608ba13afdb","resolution":{"observed_at":"2026-05-12T06:01:25.233251Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","snapshot_observed_at":"2026-07-06T15:32:01.532477Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","version":1},"cited_work":{"arxiv_id":"2305.14483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14483","snapshot_observed_at":"2026-07-01T20:56:13.461679Z","title":"arXiv preprint arXiv:2305.14483 , year =","venue":null,"work_id":"5667354d-a9b6-4f08-acd3-b5df64947505","year":2023},"citing_paper":{"arxiv_id":"2605.09395","last_updated":"2026-05-16T07:36:34Z","snapshot_observed_at":"2026-07-31T09:17:50.243143Z","submitted_at":"2026-05-10T07:47:09Z","title":"Empowering VLMs for Few-Shot Multimodal Time Series Classification via Tailored Agentic Reasoning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T22:48:49.322744Z"},"links":{"cited_paper":"/paper/2305.14483","citing_paper":"/paper/2605.09395"},"observation_digest":"sha256:f1e87ebf7592b5ef8df3fd5d677491b3960ebad29a02d3b026d699c12ba6c843","observation_id":"935ec621-b806-41bb-8664-74fac4b71b8c","resolution":{"observed_at":"2026-05-20T22:49:10.282952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","snapshot_observed_at":"2026-07-06T15:32:01.532477Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","version":1},"cited_work":{"arxiv_id":"2305.14483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14483","snapshot_observed_at":"2026-07-01T20:56:13.461679Z","title":"arXiv preprint arXiv:2305.14483 , year =","venue":null,"work_id":"5667354d-a9b6-4f08-acd3-b5df64947505","year":2023},"citing_paper":{"arxiv_id":"2605.20189","last_updated":"2026-03-23T07:18:02Z","snapshot_observed_at":"2026-08-01T19:18:00.278267Z","submitted_at":"2026-03-23T07:18:02Z","title":"SOLAR: A Self-Optimizing Open-Ended Autonomous Agent for Lifelong Learning and Continual Adaptation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-21T11:21:30.867480Z"},"links":{"cited_paper":"/paper/2305.14483","citing_paper":"/paper/2605.20189"},"observation_digest":"sha256:c9fb54393ea0c6eca0c4a9c164700fa5a71627134db8443cf5554b410f849994","observation_id":"bb69859f-194a-438b-a684-327ef2e2384c","resolution":{"observed_at":"2026-05-21T11:24:08.664516Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","snapshot_observed_at":"2026-07-06T15:32:01.532477Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","version":1},"cited_work":{"arxiv_id":"2305.14483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14483","snapshot_observed_at":"2026-07-01T20:56:13.461679Z","title":"arXiv preprint arXiv:2305.14483 , year =","venue":null,"work_id":"5667354d-a9b6-4f08-acd3-b5df64947505","year":2023},"citing_paper":{"arxiv_id":"2605.29625","last_updated":"2026-05-28T08:59:55Z","snapshot_observed_at":"2026-07-06T23:39:01.234601Z","submitted_at":"2026-05-28T08:59:55Z","title":"Improving Collaborative Storytelling with a Multi-Agent Framework Based on Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T07:36:19.786202Z"},"links":{"cited_paper":"/paper/2305.14483","citing_paper":"/paper/2605.29625"},"observation_digest":"sha256:07ecb5281245df1103b714ad3b2a4d2b0a9e5230a1cd3a1ca52a7a5ae9a03ced","observation_id":"5b85f5bf-8ad4-41b0-8a03-48eef99ed6c6","resolution":{"observed_at":"2026-06-29T07:43:14.199980Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","snapshot_observed_at":"2026-07-06T15:32:01.532477Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","version":1},"cited_work":{"arxiv_id":"2305.14483","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14483","snapshot_observed_at":"2026-07-01T20:56:13.461679Z","title":"arXiv preprint arXiv:2305.14483 , year =","venue":null,"work_id":"5667354d-a9b6-4f08-acd3-b5df64947505","year":2023},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2305.14483","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:22d970bce404b2c4a0ca3837e0af7b83acd31be151969d115329827ef1b88e41","observation_id":"6911b7cb-e2a2-4332-af9f-7fed2b06b107","resolution":{"observed_at":"2026-07-01T20:56:13.463123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","snapshot_observed_at":"2026-07-06T15:32:01.532477Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14483","snapshot_observed_at":"2026-08-08T00:57:30.462207Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03119","last_updated":"2026-08-04T04:41:20Z","snapshot_observed_at":"2026-08-08T13:22:38.627212Z","submitted_at":"2026-08-04T04:41:20Z","title":"Don't Peek at the Answer: Outcome-Masked Group Relative Policy Optimization for Label-Free RLVR","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T00:57:30.462207Z"},"links":{"cited_paper":"/paper/2305.14483","citing_paper":"/paper/2608.03119"},"observation_digest":"sha256:7f63d596d637d2c1837d99d8c9e96cc34d303548e142fcce5c35c94778e35d70","observation_id":"a1838133-bd51-4c1f-bf27-58ee53ce2e5c","resolution":{"observed_at":"2026-08-08T00:57:30.462207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.14483/citation-record","integrity":"/paper/2305.14483/integrity","json":"/paper/2305.14483/citation-record.json","paper":"/paper/2305.14483"},"outbound":[],"paper":{"arxiv_id":"2305.14483","last_updated":"2023-05-23T19:25:52Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T15:32:01.532477Z","submitted_at":"2023-05-23T19:25:52Z","title":"Language Model Self-improvement by Reinforcement Learning Contemplation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2305.14483."}