{"as_of":"2026-08-22T09:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b6330b510e9a621068e2cc222ee287777de5c481945ea57bdca67252d967330e","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:45:35.150536Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.09029/citation-record","integrity":"/paper/2505.09029/integrity","json":"/paper/2505.09029/citation-record.json","paper":"/paper/2505.09029"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.543295Z","title":"”Reinforcement learning: An introduction","venue":null,"work_id":"539200dd-cb22-416f-b89e-ca08ad420737","year":2021},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.040358Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:2d5c64c3ff6b6da79beb001c654b78a65e1e4a80dc19b5cc0f37c6a4d817807e","observation_id":"b214486c-e58f-4253-8f3b-f0f7564568bf","resolution":{"observed_at":"2026-08-15T21:45:35.547841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.527625Z","title":"”Reinforcement learning algorithms: A brief survey.” Expert Systems with Applications 231 (2023): 120495","venue":null,"work_id":"ec37aecf-fb51-4104-b0f5-9319be7d30c2","year":2023},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.045488Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:d1f2ff82421e1c16b8beaa204e398b551d10e76a45c8db5cdb82e8f664024f5a","observation_id":"cae4ee93-2c40-4817-881e-53a88a3a888f","resolution":{"observed_at":"2026-08-15T21:45:35.533228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.512819Z","title":"”Using reinforcement learning for load testing of video games.” Proceedings of the 44th international conference on software engineering","venue":null,"work_id":"13b70b1e-e6ac-4702-9704-b8bc6a565b6c","year":2022},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.050151Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:fbb94b3cb053a106f3ddab3c75d22622a9c7ef987054e6699371e912f9477cec","observation_id":"9e7cba20-a200-4130-adee-723c7eba24cd","resolution":{"observed_at":"2026-08-15T21:45:35.517836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.497757Z","title":"”A comprehensive survey of research towards AI-enabled unmanned aerial systems in pre-, active-, and post-wildfire management.” Information Fusion (2024): 102369","venue":null,"work_id":"a3cd0fb0-3950-44f6-8dc4-e714021a07e1","year":2024},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.054810Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:5ce0a2e0aa248a39a06c9842c951fc66b02c5991e3f6589eb0595a2e5f6f9edb","observation_id":"6c3251f6-180d-4827-8cb1-ca76e7cd2591","resolution":{"observed_at":"2026-08-15T21:45:35.503172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.483617Z","title":null,"venue":null,"work_id":"d21cf8a9-e639-4b60-b056-9f0c818629e7","year":2023},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.060042Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:012734cf6deacdfb940a29f2ac9f187af4dc4c47c3d93f9a55de7423a070eaa6","observation_id":"30fd499a-75dc-4bcf-b16c-6153aecc0ae8","resolution":{"observed_at":"2026-08-15T21:45:35.488101Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08844","last_updated":"2025-02-12T23:30:01Z","snapshot_observed_at":"2026-08-20T11:06:59.076112Z","submitted_at":"2025-02-12T23:30:01Z","title":"MuJoCo Playground","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08844","snapshot_observed_at":"2026-08-15T21:45:35.064770Z","title":"”MuJoCo Playground.” arXiv preprint arXiv:2502.08844 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.064770Z"},"links":{"cited_paper":"/paper/2502.08844","citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:ce5e9a575297e2a8ef002a1b52a907fc192e3da02b4ae27933820893e7e55f9f","observation_id":"0184d00b-5bf5-4fab-ac08-c62caccdaf01","resolution":{"observed_at":"2026-08-15T21:45:35.064770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.466573Z","title":"”Continuous control actions learning and adaptation for robotic manipulation through reinforcement learning.” Autonomous Robots 46.3 (2022): 483-498","venue":null,"work_id":"f0b7dede-eb1e-45af-8e70-5dd94d1b5c7e","year":2022},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.070259Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:0f2adafee53aaf470d123df1d767261d7898d22dc9f798bcc7c453362798d796","observation_id":"af29866b-345d-4b86-af39-4cf23f056e9f","resolution":{"observed_at":"2026-08-15T21:45:35.472673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.449379Z","title":"”Deep deterministic policy gradient algorithm: A systematic review.” Heliyon (2024)","venue":null,"work_id":"8a83959e-9eed-4d59-8b08-2563cc0c0bc8","year":2024},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.074744Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:fd2525b45bb341ed265b35b1cf6810541075b1d0130404767595f956bec89995","observation_id":"b5f35a32-d0f8-405b-92c3-84355e64a4ed","resolution":{"observed_at":"2026-08-15T21:45:35.455950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.433562Z","title":"”Addressing function approximation error in actor-critic methods.” International conference on machine learning","venue":null,"work_id":"efd77c72-3115-40a1-a7fc-145072ce27b8","year":2018},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.079309Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:d931061dee4a1e4f0713baed6bc9464584d3ceede9a665c11a78fea69ab08dd0","observation_id":"503de0fe-97cc-423e-8862-ca89dfbd3465","resolution":{"observed_at":"2026-08-15T21:45:35.439305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.415653Z","title":"”Stable-baselines3: Reliable reinforcement learning implementations.” Journal of machine learning research 22.268 (2021): 1-8","venue":null,"work_id":"74678296-3060-429e-a2b8-fe7bc59be01c","year":2021},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.083839Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:0b114b9147f1603eb52bf312a5073c92ca03e5bfe80872335eda9ed1c6e72ec8","observation_id":"2020f5a2-5dac-4227-b83e-ced049cbbba8","resolution":{"observed_at":"2026-08-15T21:45:35.421564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14552","last_updated":"2025-07-08T16:00:08Z","snapshot_observed_at":"2026-08-20T19:55:03.313261Z","submitted_at":"2025-03-17T22:08:02Z","title":"Eyes on the Environment: AI-Driven Analysis for Fire and Smoke Classification, Segmentation, and Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14552","snapshot_observed_at":"2026-08-15T21:45:35.088192Z","title":"”Fire and smoke datasets in 20 years: An in-depth review.” arXiv preprint arXiv:2503.14552 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.088192Z"},"links":{"cited_paper":"/paper/2503.14552","citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:93ef47a35b9b1650d5d563d869bd6d0cdabd529d379bd702e8c82972eead68c4","observation_id":"c9a48528-1cfa-4590-a1cd-9d4ee9ef4617","resolution":{"observed_at":"2026-08-15T21:45:35.088192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.398752Z","title":"Deep Reinforcement Learning Hands-On: Apply modern RL methods, with deep Q-networks, value iteration, policy gradients, TRPO, AlphaGo Zero and more","venue":null,"work_id":"3235d1d6-2210-44db-a320-2083d4da3407","year":2018},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.092822Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:c805b596014f0fb737e46465f7b65331826c7cc53e7d670ace98af45eef4cad4","observation_id":"0ce57820-9eae-4921-ad16-ec3d785ba5c2","resolution":{"observed_at":"2026-08-15T21:45:35.404273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.382771Z","title":"”AlphaZero.” Deep Reinforce- ment Learning: Fundamentals, Research and Applications (2020): 391- 415","venue":null,"work_id":"ad524d6b-aa6d-47bb-80aa-89bd85313201","year":2020},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.097469Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:883f5e3c81b2b0778134cb3676e216af5cf52c886686d88fec71d8fef4be2f71","observation_id":"eda5f139-b497-4678-85be-b4cc802f87e9","resolution":{"observed_at":"2026-08-15T21:45:35.387544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03495","last_updated":"2023-10-19T04:37:25Z","snapshot_observed_at":"2026-08-16T15:35:36.835145Z","submitted_at":"2023-05-04T15:15:22Z","title":"Automatic Prompt Optimization with \"Gradient Descent\" and Beam Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03495","snapshot_observed_at":"2026-08-15T21:45:35.101965Z","title":"”Automatic prompt optimization with” gradient descent” and beam search.” arXiv preprint arXiv:2305.03495 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.101965Z"},"links":{"cited_paper":"/paper/2305.03495","citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:bfb1648626ba18acbffba17c10f07ab81bff58c210aa33f496b48bc54ceec68d","observation_id":"866b4b9a-3db6-4e01-aa06-335aa0eef24b","resolution":{"observed_at":"2026-08-15T21:45:35.101965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.366605Z","title":"”Simulation-guided beam search for neural com- binatorial optimization.” Advances in Neural Information Processing Systems 35 (2022): 8760-8772","venue":null,"work_id":"82f39c85-a7f3-4daf-97c9-418304b523ae","year":2022},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.106933Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:248f2f4afe9ef55475f1293fdb3a7aa1dafff80c6de90f9f63198c565fa0e98a","observation_id":"c8ccdd19-8117-4251-94a3-3953d7dbfa9b","resolution":{"observed_at":"2026-08-15T21:45:35.371794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.351188Z","title":"”Monte Carlo tree search: A review of recent modifications and applications.” Artificial Intelligence Review 56.3 (2023): 2497-2562","venue":null,"work_id":"71629041-3f52-4363-99a0-0da5cc4b9fc4","year":2023},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.111345Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:2239237a575f7f999f7b7312e4604c895dec6fa7890115322aea33f273226305","observation_id":"43d36889-2ea1-4806-b25b-77e502231a41","resolution":{"observed_at":"2026-08-15T21:45:35.356588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00451","last_updated":"2024-06-17T22:11:49Z","snapshot_observed_at":"2026-08-18T09:48:11.842015Z","submitted_at":"2024-05-01T11:10:24Z","title":"Monte Carlo Tree Search Boosts Reasoning via Iterative Preference Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00451","snapshot_observed_at":"2026-08-15T21:45:35.115772Z","title":"”Monte carlo tree search boosts reasoning via iterative preference learning.” arXiv preprint arXiv:2405.00451 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.115772Z"},"links":{"cited_paper":"/paper/2405.00451","citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:52c6b240ff6dc96345ca157daf4849c6e97020115a873bbf28054f65e3f8c0ed","observation_id":"ae813dbc-8b2a-44ac-b6b5-de339479dfe9","resolution":{"observed_at":"2026-08-15T21:45:35.115772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.335492Z","title":"”Beyond greedy search: Tracking by multi-agent reinforcement learning-based beam search.” IEEE Transactions on Image Processing 31 (2022): 6239-6254","venue":null,"work_id":"bb879153-ec0d-4313-b6e3-cdd5baa5044b","year":2022},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.120482Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:8b673c47de778ba114e979cec2c26cc23f777050784751905c10d034825fb8f6","observation_id":"0315eb13-f23d-43cc-b771-cc935a2af31d","resolution":{"observed_at":"2026-08-15T21:45:35.341152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:45:35.317589Z","title":"”RL Baselines3 Zoo.” GitHub repository (2020)","venue":null,"work_id":"b7d651a0-76a0-4108-be78-e9e7e4f64ad1","year":2020},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.125457Z"},"links":{"citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:74b902c85005b3da24624a3e108c623f5db1e067b610057ef900172d8abdc314","observation_id":"b68f52c9-d7ec-4cfe-9954-f33d97a001dd","resolution":{"observed_at":"2026-08-15T21:45:35.323678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-15T21:45:35.130093Z","title":"”Openai gym.” arXiv preprint arXiv:1606.01540 (2016)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.130093Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:23b34c2ca65c7c683e8d5bbd1b102e9c7a79aac2ec9a6940919ceef80e3be685","observation_id":"d34cd3fe-9512-440a-9675-026d56de3c96","resolution":{"observed_at":"2026-08-15T21:45:35.130093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-17T07:51:41.384508Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-15T21:45:35.134938Z","title":"”Soft actor-critic algorithms and applica- tions.” arXiv preprint arXiv:1812.05905 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.134938Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:f53b3f4a396ccbaa75a22df24cf355c2a6c9b979c5e0ce7b0e6f204e93f5e1bf","observation_id":"a7f1d474-7272-4cd3-8e9b-0d075b2ae5aa","resolution":{"observed_at":"2026-08-15T21:45:35.134938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09123","last_updated":"2022-05-18T17:58:54Z","snapshot_observed_at":"2026-08-20T17:40:47.812510Z","submitted_at":"2022-05-18T17:58:54Z","title":"A2C is a special case of PPO","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09123","snapshot_observed_at":"2026-08-15T21:45:35.140853Z","title":"”A2C is a special case of PPO.” arXiv preprint arXiv:2205.09123 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.140853Z"},"links":{"cited_paper":"/paper/2205.09123","citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:80302c26009452271f58e1f1659c0d3426cf16e50620f33e08edac19a22fa1b3","observation_id":"845e944e-000f-4355-ab96-3c7494df062e","resolution":{"observed_at":"2026-08-15T21:45:35.140853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T21:45:35.146067Z","title":"”Proximal policy optimization algorithms.” arXiv preprint arXiv:1707.06347 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.146067Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:4080a55a42fd82cab70710cd78a612061dc45f490cadf32a0be2c4308648bdc1","observation_id":"6dbc1c6b-53ec-47bd-be34-3cf5cfb4fa7a","resolution":{"observed_at":"2026-08-15T21:45:35.146067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12415","last_updated":"2024-03-19T03:55:39Z","snapshot_observed_at":"2026-08-18T03:50:57.076409Z","submitted_at":"2024-03-19T03:55:39Z","title":"VisionGPT: LLM-Assisted Real-Time Anomaly Detection for Safe Visual Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12415","snapshot_observed_at":"2026-08-15T21:45:35.150536Z","title":"”Visiongpt: Llm-assisted real-time anomaly de- tection for safe visual navigation.” arXiv preprint arXiv:2403.12415 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:45:35.150536Z"},"links":{"cited_paper":"/paper/2403.12415","citing_paper":"/paper/2505.09029"},"observation_digest":"sha256:0830c0e5ed7bd07d75fa8b89338bf0c8f03bbfe7c921100b420e5de6b6a8c866","observation_id":"ff361cf6-bfb1-4f83-8c13-456afcea3f27","resolution":{"observed_at":"2026-08-15T21:45:35.150536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.09029","last_updated":"2025-05-13T23:56:12Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-20T11:05:33.705067Z","submitted_at":"2025-05-13T23:56:12Z","title":"Monte Carlo Beam Search for Actor-Critic Reinforcement Learning in Continuous Control"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2505.09029."}