{"as_of":"2026-08-22T00:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:072e165904286b69b6163a95205eb752e8c116c6e531e4f6d93cae1a93417e29","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:07:58.380043Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:28:58.626281Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":234,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:0f281db10f2783d09613f04b08babd696670439054b1cd25890b8a2d044ab2d7","observation_id":"f8659ef3-82dc-41a9-a27b-7aafb6eb37c1","resolution":{"observed_at":"2026-05-19T20:28:39.056161Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2404.13501","last_updated":"2024-04-21T01:49:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-21T01:49:46Z","title":"A Survey on the Memory Mechanism of Large Language Model based Agents","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-15T07:21:39.440092Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2404.13501"},"observation_digest":"sha256:e5b84cb8222bbe4a40977906190ad00ae289315b6bed3baab06683ebb3d6c6ea","observation_id":"c960f693-2689-47f1-85d4-6dd2a9dec05e","resolution":{"observed_at":"2026-05-15T07:21:39.992190Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-08-11T13:20:59.595233Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.13292","last_updated":"2025-04-10T02:11:49Z","snapshot_observed_at":"2026-08-19T21:57:34.208158Z","submitted_at":"2024-12-17T19:45:53Z","title":"Refining Answer Distributions for Improved Large Language Model Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T13:20:59.595233Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2412.13292"},"observation_digest":"sha256:029c791737da1c07da59522f891accba60117fae48f16b7fe4e5ae50167cc15f","observation_id":"4b153e26-3749-4212-8f15-760e5d54fba9","resolution":{"observed_at":"2026-08-11T13:20:59.595233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-08-10T21:56:12.416838Z","title":"Retroformer: Retrospective large language agents with policy gradient opti- mization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.03151","last_updated":"2025-01-06T17:18:47Z","snapshot_observed_at":"2026-08-16T16:12:12.950932Z","submitted_at":"2025-01-06T17:18:47Z","title":"Large language models for artificial general intelligence (AGI): A survey of foundational principles and approaches","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-08-10T21:56:12.416838Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2501.03151"},"observation_digest":"sha256:f5fb62dfa312227999fb9db3fbcaa859cd2b992c0e88518d705a27d5fd493d67","observation_id":"18dba6ac-c970-405b-9ed8-23e724da7a4f","resolution":{"observed_at":"2026-08-10T21:56:12.416838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2504.15965","last_updated":"2025-04-23T13:47:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T15:05:04Z","title":"From Human Memory to AI Memory: A Survey on Memory Mechanisms in the Era of LLMs","version":2},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-17T11:05:09.588491Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2504.15965"},"observation_digest":"sha256:c2dcbbd8465bb4b4f05a2d047194df2c3f0e5eb4ad05ea5c57068443222f252f","observation_id":"6682630d-db10-425d-8e0a-61d2a7e13492","resolution":{"observed_at":"2026-05-17T11:05:09.813162Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-08-16T11:07:58.380043Z","title":"Retroformer: Retrospective large language agents with policy gradient opti- mization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.16420","last_updated":"2025-04-23T05:02:51Z","snapshot_observed_at":"2026-08-17T14:22:18.404244Z","submitted_at":"2025-04-23T05:02:51Z","title":"A Survey of Foundation Model-Powered Recommender Systems: From Feature-Based, Generative to Agentic Paradigms","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T11:07:58.380043Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2504.16420"},"observation_digest":"sha256:321e4e135546333ab17b751947058b66b78b9c752e3eeae0acb31eeef7c11242","observation_id":"9ccbaf35-230a-48b0-b377-073eb13235d9","resolution":{"observed_at":"2026-08-16T11:07:58.380043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-08-15T21:08:46.705488Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.10736","last_updated":"2025-08-18T18:02:26Z","snapshot_observed_at":"2026-08-19T18:50:27.154970Z","submitted_at":"2025-05-15T22:41:30Z","title":"Model Performance-Guided Evaluation Data Selection for Effective Prompt Optimization","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T21:08:46.705488Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2505.10736"},"observation_digest":"sha256:3397219ad43fb31581305db2226edea96b2e72682fc7f7a017563aa466814de2","observation_id":"5078c01b-bbcd-4c12-a041-e024a5cc104b","resolution":{"observed_at":"2026-08-15T21:08:46.705488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-08-07T15:04:40.635704Z","title":"arXiv preprint arXiv:2308.02151","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16475","last_updated":"2025-05-22T10:03:05Z","snapshot_observed_at":"2026-08-18T17:48:07.863453Z","submitted_at":"2025-05-22T10:03:05Z","title":"ReflectEvo: Improving Meta Introspection of Small LLMs by Learning Self-Reflection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:04:40.635704Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2505.16475"},"observation_digest":"sha256:52b63ef01fc8fd3529fbaa50b3dc60e90f99a0ce7a4265c5d40446d8bf34cbfc","observation_id":"e1d86424-61ad-4b6a-ac8c-1e34c4195ff6","resolution":{"observed_at":"2026-08-07T15:04:40.635704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-08-07T00:24:14.981510Z","title":"Retroformer: Retrospective large language agents with policy gradient op- timization.ArXiv, abs/2308.02151, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.14234","last_updated":"2025-06-17T06:47:19Z","snapshot_observed_at":"2026-08-19T00:36:12.925135Z","submitted_at":"2025-06-17T06:47:19Z","title":"Xolver: Multi-Agent Reasoning with Holistic Experience Learning Just Like an Olympiad Team","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T00:24:14.981510Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2506.14234"},"observation_digest":"sha256:3b790b4111d6c1447e347abde146324bd7fc18997883f8b1ade4c4654748b78a","observation_id":"498ff026-fe3f-4f37-bd26-0a457ef52ece","resolution":{"observed_at":"2026-08-07T00:24:14.981510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-08-15T18:35:12.612649Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19652","last_updated":"2025-07-08T14:47:33Z","snapshot_observed_at":"2026-08-20T03:45:50.691672Z","submitted_at":"2025-06-24T14:15:26Z","title":"Tailored Conversations beyond LLMs: A RL-Based Dialogue Manager","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T18:35:12.612649Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2506.19652"},"observation_digest":"sha256:be99dd764c7ffaef0ecac2bd34fc108ba3f358c476a74d7e1bfc47032d3ad7df","observation_id":"c23a2c9e-f99b-4001-8865-9b3490f4bf92","resolution":{"observed_at":"2026-08-15T18:35:12.612649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-08-15T04:46:13.708162Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-08T10:23:52.522238Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:1cb2c1de5abb05517f2de3d3b11c6a41448ff22ba0d983a6b35a932560bbab26","observation_id":"d97be4d3-3c47-4cd2-b2ba-ae416b0d23cf","resolution":{"observed_at":"2026-05-11T20:06:08.681011Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-08-15T04:46:13.708162Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-11T02:00:00.663355Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:c499696a4b264793a4143b2930182822a5359c56db1476ce2cf45356b4afe154","observation_id":"fd45479c-89ef-47c3-8787-9f632c461736","resolution":{"observed_at":"2026-05-11T04:00:56.846868Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2605.06130","last_updated":"2026-05-12T10:25:23Z","snapshot_observed_at":"2026-08-15T04:46:13.708162Z","submitted_at":"2026-05-07T12:33:30Z","title":"Skill1: Unified Evolution of Skill-Augmented Agents via Reinforcement Learning","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-13T07:17:13.708752Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2605.06130"},"observation_digest":"sha256:0d2f677997607aa20de5edbc4bb626a27a77eb26e6fb2235d9b2686860b17f6e","observation_id":"2257a956-2335-440d-96e2-ff68c3f54f44","resolution":{"observed_at":"2026-05-13T07:17:28.208672Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2605.07358","last_updated":"2026-05-26T05:21:04Z","snapshot_observed_at":"2026-08-21T11:38:38.855050Z","submitted_at":"2026-05-08T07:10:26Z","title":"A Comprehensive Survey on Agent Skills: Taxonomy, Techniques, and Applications","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T01:47:39.926540Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2605.07358"},"observation_digest":"sha256:9d1ebd2621b6752c7e6c31d59da341887af54160bf42c3cca8d75354ab96c87d","observation_id":"e9983242-aa4a-4fd2-b415-f426ffd395d4","resolution":{"observed_at":"2026-05-11T04:20:57.093072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2605.07358","last_updated":"2026-05-26T05:21:04Z","snapshot_observed_at":"2026-08-21T11:38:38.855050Z","submitted_at":"2026-05-08T07:10:26Z","title":"A Comprehensive Survey on Agent Skills: Taxonomy, Techniques, and Applications","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T23:15:44.550045Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2605.07358"},"observation_digest":"sha256:e005a95b0777e546bd6044af6fae2d88d7fd7c95f0dcc8f48bae2e1db2a4503e","observation_id":"919c1440-c2f1-490e-b7ce-0b418b1e4dae","resolution":{"observed_at":"2026-05-20T23:19:14.904430Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2605.07358","last_updated":"2026-05-26T05:21:04Z","snapshot_observed_at":"2026-08-21T11:38:38.855050Z","submitted_at":"2026-05-08T07:10:26Z","title":"A Comprehensive Survey on Agent Skills: Taxonomy, Techniques, and Applications","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T23:23:42.883286Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2605.07358"},"observation_digest":"sha256:0d4404c2e511342a8b8c032c72297c7e81e7b85b2429220c313daabf67098fb0","observation_id":"20f42e94-cf13-40f8-96f7-4ab6f5e594db","resolution":{"observed_at":"2026-06-30T23:25:07.333934Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2605.20477","last_updated":"2026-05-19T20:41:12Z","snapshot_observed_at":"2026-08-15T06:17:21.715891Z","submitted_at":"2026-05-19T20:41:12Z","title":"Training Language Agents to Learn from Experience","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T07:11:09.642275Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2605.20477"},"observation_digest":"sha256:c5ac21284f367878db50686c48174b642c26f0b49a3a1b3be3bf490583e1c8b8","observation_id":"b931cb18-5ab5-47e2-b9d4-e2fa4fe981fe","resolution":{"observed_at":"2026-05-21T07:14:02.615242Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":"2308.02151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-07-03T21:28:58.626281Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization","venue":null,"work_id":"5ba6e856-a1a3-4e39-a447-f2351841a251","year":2023},"citing_paper":{"arxiv_id":"2606.18235","last_updated":"2026-06-16T17:56:57Z","snapshot_observed_at":"2026-08-05T03:00:41.649486Z","submitted_at":"2026-06-16T17:56:57Z","title":"EvolveNav: Proactive Preflection and Self-Evolving Memory for Zero-Shot Object Goal Navigation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-27T00:34:47.530464Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2606.18235"},"observation_digest":"sha256:cad6a304bbe383f59054397ea1a20d5f814a542c294250b498690d93216cd405","observation_id":"84dc25dd-01a6-4f6c-a937-6bf2731214a6","resolution":{"observed_at":"2026-07-03T21:28:58.628130Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02151","snapshot_observed_at":"2026-08-02T13:58:42.937172Z","title":"Retroformer: Retrospective large language agents with policy gradient optimization.arXiv preprint arXiv:2308.02151, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18258","last_updated":"2026-05-15T09:09:57Z","snapshot_observed_at":"2026-08-15T02:29:53.498306Z","submitted_at":"2026-05-15T09:09:57Z","title":"S2T-RLHF: Hierarchical Credit Assignment for Stable Preference-Based RLHF","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T13:58:42.937172Z"},"links":{"cited_paper":"/paper/2308.02151","citing_paper":"/paper/2607.18258"},"observation_digest":"sha256:46600c71203a9055214b1da9afb7e0d64263b219b764568aebf952e7e6d173bd","observation_id":"2d5a709f-7554-4495-9096-3cfa72d7bed2","resolution":{"observed_at":"2026-08-02T13:58:42.937172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2308.02151/citation-record","integrity":"/paper/2308.02151/integrity","json":"/paper/2308.02151/citation-record.json","paper":"/paper/2308.02151"},"outbound":[],"paper":{"arxiv_id":"2308.02151","last_updated":"2024-05-05T05:04:49Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-21T07:51:55.381083Z","submitted_at":"2023-08-04T06:14:23Z","title":"Retroformer: Retrospective Large Language Agents with Policy Gradient Optimization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2308.02151."}