{"as_of":"2026-08-14T17:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c9147468f45d0f93b1a486fc3d8e48f415b0cd4c40e528909d910d7da1672b7a","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:36:02.619219Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.06053/citation-record","integrity":"/paper/2509.06053/integrity","json":"/paper/2509.06053/citation-record.json","paper":"/paper/2509.06053"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:01.718482Z","title":"Reinforcement learning in robotics: A survey.The International Journal of Robotics Research, 32(11):1238–1274, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-09T09:47:00.526027Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:01.718482Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:fb765ae3b2827ac76524b7282d059ee115797f10d61f1c4ef0a5da69d186b8f1","observation_id":"76069711-87f4-4052-8c95-f8b4ad411aac","resolution":{"observed_at":"2026-08-05T04:36:01.718482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.878866Z","title":"Sim-to-real robot learning from pixels with progressive nets","venue":null,"work_id":"f50a7396-d23c-4554-8b4b-3a31d56bb053","year":2017},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-09T09:47:00.526027Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:01.757271Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:85d992578041f4287e6375bfc28629dc29d30d85ba8cc982319e8af1afdf17bc","observation_id":"8adbcd51-4595-448a-a98f-249794217e54","resolution":{"observed_at":"2026-08-05T04:36:03.881420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.871064Z","title":"Google research football: A novel reinforcement learning environment","venue":null,"work_id":"27670ca4-da76-421d-a7d2-0266c7992fc5","year":2020},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-09T09:47:00.526027Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:01.838723Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:d6ce2da98027acb5fccd8a3e7c8a8b5d59820bbb6a70a753b6483c7a778a6b14","observation_id":"a4d57b60-a009-40e3-86e1-db4827171bc6","resolution":{"observed_at":"2026-08-05T04:36:03.873689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.863508Z","title":"A comprehensive review of multi-agent reinforcement learning in video games.IEEE Transactions on Games, 2025","venue":null,"work_id":"fe04c411-9fc9-4433-86b0-d8f6f4f6a770","year":2025},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-09T09:47:00.526027Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:01.932070Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:b3ec038e645080e2464ca58b9ce7e82ac43c8bac6812a02ae1d2cbca595e8bd7","observation_id":"60035789-2acb-46d4-939c-dc77ac2ab32a","resolution":{"observed_at":"2026-08-05T04:36:03.866070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.855979Z","title":"Robustness and sample complexity of model-based marl for general-sum markov games.Dynamic Games and Applications, 13(1):56–88, 2023","venue":null,"work_id":"d2a002c1-4672-489f-a150-760b85fcb6a0","year":2023},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-09T09:47:00.526027Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:01.986521Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:107497cbaaec42ab639fe96425dcbc7511f535623abb54a929ded9b9f40e3e86","observation_id":"7aa75364-9c6c-42ee-89bc-0c6262147ced","resolution":{"observed_at":"2026-08-05T04:36:03.858739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.848157Z","title":"Multi-agent reinforcement learning for autonomous driving: A survey.CoRR, 2024","venue":null,"work_id":"c77c7db4-c1a8-4a5d-bcbc-adcfb75958c3","year":2024},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-09T09:47:00.526027Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.046727Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:e31edab11eef241e7c29b02a90b21b99f113e43a396f9cf3a234a91301ebdfb4","observation_id":"d96436a9-e1dc-4079-80a9-0716bb5a3cd9","resolution":{"observed_at":"2026-08-05T04:36:03.850909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:02.077841Z","title":"Deep reinforcement learning for autonomous driving: A survey.IEEE transactions on intelligent transportation systems, 23(6):4909–4926, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-09T09:47:00.526027Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.077841Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:2d67350ebc1ee6826f3ebb4d3a1528372522dd6230802d482360299fdf496c41","observation_id":"cfcdfffe-0dfd-4d28-8cba-ca5f3d0de4ed","resolution":{"observed_at":"2026-08-05T04:36:02.077841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2406.08844","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.014980Z","title":"Equilibrium selection for multi-agent reinforcement learning: A unified framework.arXiv preprint arXiv:2406.08844, 2024","venue":null,"work_id":"352eda20-a6fa-4a93-af99-fc9ba1c9cd05","year":2024},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-09T09:47:00.526027Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.132762Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:62fabc8f684408d81e483a385a28e2c949e4b32a3231da293817814aff3464d6","observation_id":"9825a211-cfb7-454e-98c8-5c2db3c02ff8","resolution":{"observed_at":"2026-08-05T04:36:03.079984Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.835144Z","title":"Emergent reciprocity and team formation from randomized uncertain social preferences.Advances in neural information processing systems, 33:15786–15799, 2020","venue":null,"work_id":"41b50c79-4f59-40e5-970c-c799f1446bfa","year":2020},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-09T09:47:00.526027Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.184973Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:a76819bf3305e88eef799fe072a38a13644aaf4dd80adf04c67f1e087d945294","observation_id":"9987f2c2-1689-4a8e-8760-18d0312108a2","resolution":{"observed_at":"2026-08-05T04:36:03.837935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.718867Z","title":"Taxai: A dynamic economic simulator and benchmark for multi-agent reinforcement learning","venue":null,"work_id":"606684d6-f360-4ce9-a398-9220a621187f","year":2024},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-09T09:47:00.526027Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.269117Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:63753a511976361dab4f0c6ad11ee5b6797b8e2b568d03e228c210c28189d41e","observation_id":"32ae72e4-5c42-4870-9f13-c7450bd67df1","resolution":{"observed_at":"2026-08-05T04:36:03.772790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.603183Z","title":"A new approach to solving smac task: Generating decision tree code from large language models.arXiv e-prints, pages arXiv–2410, 2024","venue":null,"work_id":"0262a3e3-690e-42d4-8f30-714b50aea03e","year":2024},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-09T09:47:00.526027Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.321874Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:285fac310a0ce5baa1e36ca6e74239ba771db2a0210fc580794aedc4e48b1666","observation_id":"eb2d90d7-842f-419e-8e66-3481a3a2bc57","resolution":{"observed_at":"2026-08-05T04:36:03.676990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.14299","last_updated":"2025-06-17T08:18:20Z","snapshot_observed_at":"2026-08-09T09:46:23.571557Z","submitted_at":"2025-06-17T08:18:20Z","title":"ADRD: LLM-Driven Autonomous Driving Based on Rule-based Decision Systems","version":1},"cited_work":{"arxiv_id":"2506.14299","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.14299","snapshot_observed_at":"2026-08-05T04:36:02.697356Z","title":"ADRD: LLM-Driven Autonomous Driving Based on Rule-based Decision Systems","venue":"cs.AI","work_id":"20ee3b3c-f83d-42ed-8b30-d2268a02e922","year":2025},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-09T09:47:00.526027Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.379064Z"},"links":{"cited_paper":"/paper/2506.14299","citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:7ed5595dc207fac947cdd608eaa656beb9d475436f02cec324321406bea6a4d7","observation_id":"fee254cb-faf1-426e-88f5-9317392408f4","resolution":{"observed_at":"2026-08-05T04:36:02.769162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.411513Z","title":"Language models speed up local search for finding programmatic policies.Transactions on Machine Learning Research, 20(X), 2024","venue":null,"work_id":"748e0b7f-7580-4d8c-bbee-1a904d6f8ad9","year":2024},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-09T09:47:00.526027Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.461787Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:42c9e6f47af9fc9c75d28ea9520bf370dac68ae321fa42aca798e591333cfecb","observation_id":"9929797c-8d60-4e4f-b4bb-40cab986b4bd","resolution":{"observed_at":"2026-08-05T04:36:03.500218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.259975Z","title":"Synthesizing programmatic reinforcement learning policies with large language model guided search","venue":null,"work_id":"a0d031b6-b19e-4b99-9cbc-c6a76a229aa9","year":null},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-09T09:47:00.526027Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.507355Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:ac2e852c8bbcd0ba8244f384f969ece3a303f42c791f81ae0b459a879b23bbb4","observation_id":"55979992-ad1f-4405-abe3-e55b1f3cd0d8","resolution":{"observed_at":"2026-08-05T04:36:03.328505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:02.563015Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advances in neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-09T09:47:00.526027Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.563015Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:8f1faf9244b5d149e921437b2c01342f4e51963b8248fa84513f3f4bbd251c07","observation_id":"8af0bf21-4f54-4731-88bc-7bfe7d8d2ad2","resolution":{"observed_at":"2026-08-05T04:36:02.563015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:36:03.146763Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":"de4e584c-3aed-4450-8031-f7c808e1da89","year":2023},"citing_paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","snapshot_observed_at":"2026-08-09T09:47:00.526027Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T04:36:02.619219Z"},"links":{"citing_paper":"/paper/2509.06053"},"observation_digest":"sha256:b0ec1e46b58bb13de40150df57f18321cf2c6136a5f6b978c8a50358ba63c36a","observation_id":"261bd7e9-b332-4bd3-b498-d0d70c55ef7a","resolution":{"observed_at":"2026-08-05T04:36:03.210132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.06053","last_updated":"2025-09-07T13:33:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T09:47:00.526027Z","submitted_at":"2025-09-07T13:33:31Z","title":"PolicyEvolve: Evolving Programmatic Policies by LLMs for multi-player games via Population-Based Training"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2509.06053."}