{"as_of":"2026-08-09T20:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d69ec3024f8e85c4522c2e905c64878cc31c31671b1b5917f4fdf65ff64fd2c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:25:00.049554Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T15:34:48.385189Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.13373","last_updated":"2024-05-27T14:00:23Z","snapshot_observed_at":"2026-08-06T03:13:32.023655Z","submitted_at":"2023-11-22T13:15:42Z","title":"Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13373","snapshot_observed_at":"2026-08-07T15:25:00.049554Z","title":"Large language model as a policy teacher for training reinforcement learning agents.arXiv preprint arXiv:2311.13373, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15306","last_updated":"2025-05-21T09:35:43Z","snapshot_observed_at":"2026-08-08T16:10:51.391638Z","submitted_at":"2025-05-21T09:35:43Z","title":"Multiple Weaks Win Single Strong: Large Language Models Ensemble Weak Reinforcement Learning Agents into a Supreme One","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:25:00.049554Z"},"links":{"cited_paper":"/paper/2311.13373","citing_paper":"/paper/2505.15306"},"observation_digest":"sha256:b3378bb239a4c83fb9d0305615b3aea9556bd8a5ab2205499b8fc8923ed7e52c","observation_id":"dcc67497-61f2-4cda-bb79-433cc4f087b4","resolution":{"observed_at":"2026-08-07T15:25:00.049554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13373","last_updated":"2024-05-27T14:00:23Z","snapshot_observed_at":"2026-08-06T03:13:32.023655Z","submitted_at":"2023-11-22T13:15:42Z","title":"Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13373","snapshot_observed_at":"2026-08-07T11:18:46.991142Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02951","last_updated":"2025-07-23T03:40:09Z","snapshot_observed_at":"2026-08-09T14:13:39.797355Z","submitted_at":"2025-06-03T14:46:00Z","title":"Adaptive Graph Pruning for Multi-Agent Communication","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:18:46.991142Z"},"links":{"cited_paper":"/paper/2311.13373","citing_paper":"/paper/2506.02951"},"observation_digest":"sha256:18780099ac68390f993cc01afc213b79554dbec0c66f57108e60a0675e1d9e37","observation_id":"8d5c5761-013b-439b-8053-a89b1157fb5b","resolution":{"observed_at":"2026-08-07T11:18:46.991142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13373","last_updated":"2024-05-27T14:00:23Z","snapshot_observed_at":"2026-08-06T03:13:32.023655Z","submitted_at":"2023-11-22T13:15:42Z","title":"Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13373","snapshot_observed_at":"2026-08-04T20:49:37.871050Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08329","last_updated":"2025-09-10T07:08:04Z","snapshot_observed_at":"2026-08-08T18:17:32.489262Z","submitted_at":"2025-09-10T07:08:04Z","title":"Accelerating Reinforcement Learning Algorithms Convergence using Pre-trained Large Language Models as Tutors With Advice Reusing","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-04T20:49:37.871050Z"},"links":{"cited_paper":"/paper/2311.13373","citing_paper":"/paper/2509.08329"},"observation_digest":"sha256:2326c9df4abcaafbdfa43042ccdf1a7bc0ff951168ef5f5f207cbc03f6bae357","observation_id":"328e2211-4bb1-46a9-81e1-360362a1d399","resolution":{"observed_at":"2026-08-04T20:49:37.871050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13373","last_updated":"2024-05-27T14:00:23Z","snapshot_observed_at":"2026-08-06T03:13:32.023655Z","submitted_at":"2023-11-22T13:15:42Z","title":"Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents","version":6},"cited_work":{"arxiv_id":"2311.13373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.13373","snapshot_observed_at":"2026-06-30T15:34:48.385189Z","title":"Large language model is a good policy teacher for training reinforcement learning agents","venue":null,"work_id":"939f8e87-2c29-437b-93a1-ad9d5fdee476","year":2009},"citing_paper":{"arxiv_id":"2602.04129","last_updated":"2026-05-06T00:09:55Z","snapshot_observed_at":"2026-07-06T22:44:28.488131Z","submitted_at":"2026-02-04T01:46:02Z","title":"KGLAMP: Knowledge Graph-guided Language model for Adaptive Multi-robot Planning and Replanning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T08:07:48.508022Z"},"links":{"cited_paper":"/paper/2311.13373","citing_paper":"/paper/2602.04129"},"observation_digest":"sha256:a09e8b6a8429a6266e26c3cadc2566cbdf28ea384b3005e50078e00eeb0d9cdb","observation_id":"2d79072f-fde0-4884-bf6a-a5115394394e","resolution":{"observed_at":"2026-05-16T08:10:45.591012Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13373","last_updated":"2024-05-27T14:00:23Z","snapshot_observed_at":"2026-08-06T03:13:32.023655Z","submitted_at":"2023-11-22T13:15:42Z","title":"Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents","version":6},"cited_work":{"arxiv_id":"2311.13373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.13373","snapshot_observed_at":"2026-06-30T15:34:48.385189Z","title":"Large language model is a good policy teacher for training reinforcement learning agents","venue":null,"work_id":"939f8e87-2c29-437b-93a1-ad9d5fdee476","year":2009},"citing_paper":{"arxiv_id":"2605.17359","last_updated":"2026-05-17T09:55:18Z","snapshot_observed_at":"2026-08-02T23:39:33.688741Z","submitted_at":"2026-05-17T09:55:18Z","title":"Learning Transferable Topology Priors for Multi-Agent LLM Collaboration Across Domains","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T13:38:07.140289Z"},"links":{"cited_paper":"/paper/2311.13373","citing_paper":"/paper/2605.17359"},"observation_digest":"sha256:b7c0bd150a64b8a5f26f3c552c7bf9d5e6e11743e74122ae7aa8252dcbfdcfc0","observation_id":"d97c92c8-23ea-48e7-886e-eb0719a2c374","resolution":{"observed_at":"2026-05-20T13:38:19.074837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13373","last_updated":"2024-05-27T14:00:23Z","snapshot_observed_at":"2026-08-06T03:13:32.023655Z","submitted_at":"2023-11-22T13:15:42Z","title":"Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents","version":6},"cited_work":{"arxiv_id":"2311.13373","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.13373","snapshot_observed_at":"2026-06-30T15:34:48.385189Z","title":"Large language model is a good policy teacher for training reinforcement learning agents","venue":null,"work_id":"939f8e87-2c29-437b-93a1-ad9d5fdee476","year":2009},"citing_paper":{"arxiv_id":"2606.00083","last_updated":"2026-05-22T16:04:22Z","snapshot_observed_at":"2026-08-02T22:15:21.959965Z","submitted_at":"2026-05-22T16:04:22Z","title":"From Demonstrations to Rewards: Test-Time Prompt Optimization for VLM Reward Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T15:25:14.906470Z"},"links":{"cited_paper":"/paper/2311.13373","citing_paper":"/paper/2606.00083"},"observation_digest":"sha256:b00fc6c51931c292c99b9157923c6af3f7f052ac95b96679aa68ab15b1d7eb60","observation_id":"5b19795d-25be-4734-abfd-b363cd9aa9aa","resolution":{"observed_at":"2026-06-30T15:34:48.386630Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2311.13373/citation-record","integrity":"/paper/2311.13373/integrity","json":"/paper/2311.13373/citation-record.json","paper":"/paper/2311.13373"},"outbound":[],"paper":{"arxiv_id":"2311.13373","last_updated":"2024-05-27T14:00:23Z","latest_version":6,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T03:13:32.023655Z","submitted_at":"2023-11-22T13:15:42Z","title":"Large Language Model as a Policy Teacher for Training Reinforcement Learning Agents"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2311.13373."}