{"as_of":"2026-08-10T16:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:97e222451391bafdb99718d3020562d10c643f8fbe38c202a05808563b1bba87","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:55:44.534042Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.06376/citation-record","integrity":"/paper/2506.06376/integrity","json":"/paper/2506.06376/citation-record.json","paper":"/paper/2506.06376"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T10:55:44.248408Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.248408Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:66239392c45beee4c9d276b77d3ecba2eb7671096c4531c2bb290a79143509df","observation_id":"8545f206-1b6b-4f21-a513-9e004cf2015a","resolution":{"observed_at":"2026-08-07T10:55:44.248408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.148420Z","title":"G., Sutton, R","venue":null,"work_id":"ac3eeaa8-5c9d-4179-9486-3ed91cbe7cad","year":1989},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.251820Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:7fe99d2eb835ae553ba4760fa432163d03618c88c9a96de5bd7527ae98f90ea5","observation_id":"975e3704-223f-425f-a56b-12dfa3596532","resolution":{"observed_at":"2026-08-07T10:55:45.151052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.139959Z","title":"L., and Singh, S","venue":null,"work_id":"507f22d2-bc64-40d8-894d-492cb28aa4e9","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.255161Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:a54bc45cae8935111a77f1dc4947069391b044319e25bbbe9480e969803dba9d","observation_id":"2168a1e0-8dd4-455f-9f7b-18017c98c202","resolution":{"observed_at":"2026-08-07T10:55:45.142798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.130773Z","title":"The computational complexity of propositional strips planning","venue":null,"work_id":"168f13a7-4e0e-499d-ad66-a35d96550594","year":1994},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.258099Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:c1f7fddb8723b69d35ceac80d86a04224bbc24a85ce10af0ef9434f8947b52de","observation_id":"b7f2a298-d835-4bd1-af34-06a57bb0be0e","resolution":{"observed_at":"2026-08-07T10:55:45.133991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.121770Z","title":"Grounding large language models in interactive environments with online reinforcement learning","venue":null,"work_id":"593dc9f9-f735-49aa-ba1d-5b0c764db4e3","year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.261230Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:868fb466b6a22d64464d16aa4253c2d5c4f61230802afedd73959282cba6ac2c","observation_id":"dd9d9076-8045-41db-8410-883e6b4081fd","resolution":{"observed_at":"2026-08-07T10:55:45.124847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.112950Z","title":"Grounding large language models in interactive environments with online reinforcement learning, 2023 b","venue":null,"work_id":"f318f237-5f72-4292-8e70-866faa42636e","year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.264183Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:8e0d24ec0dd2ab1005c8c87daed5be86719ac352854e869f97d63dc4fa3237a5","observation_id":"59c50699-e384-45a9-acfe-58921f6706d3","resolution":{"observed_at":"2026-08-07T10:55:45.115918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.267264Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.267264Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:5e08bfd7356d0b1014ebcbd8935722e0aa487b797c84c3679c514ffffedb2be8","observation_id":"77a7d3de-3672-4db1-bbcd-0534a24b3157","resolution":{"observed_at":"2026-08-07T10:55:44.267264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08272","last_updated":"2019-12-19T15:44:33Z","snapshot_observed_at":"2026-08-08T23:50:48.318949Z","submitted_at":"2018-10-18T20:48:08Z","title":"BabyAI: A Platform to Study the Sample Efficiency of Grounded Language Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.08272","snapshot_observed_at":"2026-08-07T10:55:44.269879Z","title":"H., and Bengio, Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.269879Z"},"links":{"cited_paper":"/paper/1810.08272","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:4f36644fbc7cfe92aff0309e2808168bbd2ea9abd3cf00539a4fae0de4e6d9bb","observation_id":"ebaae906-8f3d-45cc-b8ea-90587c083b3a","resolution":{"observed_at":"2026-08-07T10:55:44.269879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.098587Z","title":"Efficient selectivity and backup operators in monte-carlo tree search","venue":null,"work_id":"4f591ba0-ae5f-476a-856f-592648914224","year":2006},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.272705Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:7f6af2b3c5d09eea50d512a1ef99ca67f2bba80f02d8c0a38e528f149aeb5c1a","observation_id":"ab4c0389-bc79-472f-bb80-913288a16547","resolution":{"observed_at":"2026-08-07T10:55:45.101508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08235","last_updated":"2025-02-12T09:23:26Z","snapshot_observed_at":"2026-08-10T00:41:29.483613Z","submitted_at":"2025-02-12T09:23:26Z","title":"The Danger of Overthinking: Examining the Reasoning-Action Dilemma in Agentic Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08235","snapshot_observed_at":"2026-08-07T10:55:44.275248Z","title":"G., Xia, T., Mao, H., et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.275248Z"},"links":{"cited_paper":"/paper/2502.08235","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:419a794d46930f7ea9c6ce279e14ae1bb20931062dc38dc803617b3cf9ce30f8","observation_id":"273a0c2d-3aa1-46e3-917f-7a4d294b61ee","resolution":{"observed_at":"2026-08-07T10:55:44.275248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T10:55:44.278393Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.278393Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:70c8628848b8423240dc9f1b06dbac4ffd1819ab95441fae42baf84dfd1b355f","observation_id":"e6b75a92-a039-4a5c-b076-ea2abdecd9b8","resolution":{"observed_at":"2026-08-07T10:55:44.278393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.089747Z","title":"Task and motion planning with large language models for object rearrangement","venue":null,"work_id":"3b8124ec-51e0-4c65-abbc-65dd22df9618","year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.281136Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:4eda5e4347bda706034dce214bb9240dda14d222d52c396f1c9faecb4542b64c","observation_id":"4bd6fbee-d000-4806-ac94-da470ee7782e","resolution":{"observed_at":"2026-08-07T10:55:45.092899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.081101Z","title":"Low-rank modular reinforcement learning via muscle synergy","venue":null,"work_id":"70871171-3882-45de-9c6c-a8166dc1612b","year":2022},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.283993Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:05c018bbc72168aa06d88d806d7e94c4484834bfaa5ba0f11845fffc17eaa28b","observation_id":"06fd3275-af0c-40da-9583-c506bf321a1f","resolution":{"observed_at":"2026-08-07T10:55:45.083971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11534","last_updated":"2024-12-05T04:40:54Z","snapshot_observed_at":"2026-08-06T11:30:50.211440Z","submitted_at":"2024-02-18T10:15:38Z","title":"PreAct: Prediction Enhances Agent's Planning Ability","version":2},"cited_work":{"arxiv_id":"2402.11534","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11534","snapshot_observed_at":"2026-08-07T10:55:44.764484Z","title":"PreAct: Prediction Enhances Agent's Planning Ability","venue":"cs.CL","work_id":"78bcb03e-e6ba-4beb-9c10-f0e3e95914ab","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.286512Z"},"links":{"cited_paper":"/paper/2402.11534","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:74c36bbe7d473884d98b203505a6f572d122d1a91d983523f5961b4fb457964a","observation_id":"fde0f198-05f3-43e7-8456-d66dcd5d460c","resolution":{"observed_at":"2026-08-07T10:55:44.767850Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.289495Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.289495Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:611fd668b5d18338ddeb1011e219aa9d1e48c15db004c08f6aed70b3a95bd560","observation_id":"62c6fff1-2d4d-4c47-96ec-20ee9e47d33c","resolution":{"observed_at":"2026-08-07T10:55:44.289495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.066598Z","title":"Aligning language models with preferences through f -divergence minimization","venue":null,"work_id":"6de0853f-631d-44b5-b983-8dd756051490","year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.292179Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:6a70bbd3669750638bf41ab73ea85c1679f415ed07536854170929bcfe605745","observation_id":"edc425d8-0a9b-413f-aa1c-6f753ce0daea","resolution":{"observed_at":"2026-08-07T10:55:45.069984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.058102Z","title":"Benchmarking the spectrum of agent capabilities","venue":null,"work_id":"45e07c5c-e8d8-4993-91ac-5442abfba495","year":2022},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.294660Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:3f575aef2bdcd9471dcec237db50e26d6bd26b2df1c71dfbd8a811aebc99d34a","observation_id":"2ac67d04-99fa-490c-9ed6-559499e0f2bc","resolution":{"observed_at":"2026-08-07T10:55:45.061015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.297209Z","title":"Reasoning with language model is planning with world model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.297209Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:d72eb15d817b37abfccf6b5239d53bbf515a49e6d2201c23883a6f75e068f7c4","observation_id":"f79bef7e-05f9-42d3-b19d-2cb02e04ca24","resolution":{"observed_at":"2026-08-07T10:55:44.297209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.300066Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.300066Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:84a2ec402f2e3730dbd1a737a496e4748844a56ae7b613090c002a29af6b0b61","observation_id":"9e9defb4-19ea-4433-b16f-14bfa5b8bebc","resolution":{"observed_at":"2026-08-07T10:55:44.300066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10403","last_updated":"2023-05-26T17:59:33Z","snapshot_observed_at":"2026-08-06T19:23:30.079167Z","submitted_at":"2022-12-20T16:29:03Z","title":"Towards Reasoning in Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10403","snapshot_observed_at":"2026-08-07T10:55:44.302536Z","title":"and Chang, K","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.302536Z"},"links":{"cited_paper":"/paper/2212.10403","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:5862b483d8a049faa819f82a7139dee572a29a1d9fa2beef1da0804035f2a142","observation_id":"83373baa-7c68-4e5b-8faf-e54c545eef5d","resolution":{"observed_at":"2026-08-07T10:55:44.302536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.043099Z","title":"One policy to control them all: Shared modular policies for agent-agnostic control","venue":null,"work_id":"88d8ea76-545b-4a8b-9746-255e5a6dd013","year":2020},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.305625Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:2de4840668f7327b99b1458bd24a1d77cde84a5f531a7a40424c2d2f97a5576b","observation_id":"48bf0bc7-2a31-4f5f-9ece-ee18bb0f71ae","resolution":{"observed_at":"2026-08-07T10:55:45.046114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.034154Z","title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents","venue":null,"work_id":"aa3545bc-0ce8-4416-ae82-a6376c340768","year":2022},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.308201Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:7978e48da138df4ae31fa4c0f0df18c0442151a139266e4cc2ee2f05818b131e","observation_id":"c654ec8b-8bc6-4ae6-b158-f6bab095a8d6","resolution":{"observed_at":"2026-08-07T10:55:45.037344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-08T09:48:52.583612Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-07T10:55:44.310610Z","title":"Inner monologue: Embodied reasoning through planning with language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.310610Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:73ddccc5841b7792493587c2fe9517d1dd8a665d34fb6049e7b7101fe5eabb36","observation_id":"5b95ead7-6844-4ec6-9344-38c735df3674","resolution":{"observed_at":"2026-08-07T10:55:44.310610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.025474Z","title":null,"venue":null,"work_id":"3d181765-56c3-467c-abda-89b3af8a055e","year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.313193Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:776f33c3dc69a41dee835167814673e1c446aa9f19d0f56541ae99decadc6879","observation_id":"f85e32c8-2672-4350-b218-7b57feb692c0","resolution":{"observed_at":"2026-08-07T10:55:45.028202Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.016361Z","title":"Learning trajectory preferences for manipulators via iterative improvement","venue":null,"work_id":"9cc9519f-ac73-4f38-bebc-c129eb4d860e","year":2013},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.315854Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:237ea8f5293d3ed8a396f4fc6fc70d5196e9396ce69a48d6bf7c8ebd0aabaceb","observation_id":"f5e38c5e-38e8-475c-a4eb-10f94397855f","resolution":{"observed_at":"2026-08-07T10:55:45.019246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T10:55:44.318509Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.318509Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:adb849eec94ca5e446032a72bdc33950ef0b30ab91c012a362c4223fc7f4c138","observation_id":"e3497c31-e362-41c9-85e0-4957d8befcd4","resolution":{"observed_at":"2026-08-07T10:55:44.318509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.322888Z","title":"A comprehensive survey on process-oriented automatic text summarization with exploration of llm-based methods","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.322888Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:d76eebe41e71e6bc3a030a2d86e10ad0b48b6833daaa54ff14771762ed2c288e","observation_id":"35d14291-865b-47b3-bc22-8e4d096f8785","resolution":{"observed_at":"2026-08-07T10:55:44.322888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:45.007658Z","title":null,"venue":null,"work_id":"2a15495c-8cc6-4e37-ae72-75ab58485613","year":1995},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.325521Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:9e555fe48308c933d6f5cf9089ab4e38f247d9feef8acf5a3ee1c4a6217d622b","observation_id":"ec19ea2e-4a17-4001-aefa-b0986b28b35a","resolution":{"observed_at":"2026-08-07T10:55:45.010508Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.328311Z","title":"and Szepesv \\'a ri, C","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.328311Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:c139e940ef6133d3bb4a895aea65992301bf01927d75acd140fc010af1a75c6c","observation_id":"e0343ef6-cb72-4f1d-ae60-525af75069d9","resolution":{"observed_at":"2026-08-07T10:55:44.328311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.331022Z","title":"Y., McAleer, S., Fried, D., and Salakhutdinov, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.331022Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:c3ffef13da3fffee0cfca944daf957717a4dd313d375e4c9f5c6e32b5843c71f","observation_id":"7908c0e6-fd04-48d2-ad92-4408d6c67248","resolution":{"observed_at":"2026-08-07T10:55:44.331022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.333655Z","title":"S., Reid, M., Matsuo, Y., and Iwasawa, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.333655Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:df1bb5896f134e9bf9cb34380520f6ac95dfed19f872aa29db124dd8a7a8d0db","observation_id":"a814a2f7-f3ec-4560-8c0a-c83797b52dba","resolution":{"observed_at":"2026-08-07T10:55:44.333655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.336377Z","title":"X., Nie, J.-Y., and Wen, J.-R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.336377Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:db39b3c525e4202b893d819cbe334c087bb1d8e67b589b177a13dc3959e65ac5","observation_id":"277a3b96-7b11-488d-a7dd-1ca7ca2b1ddf","resolution":{"observed_at":"2026-08-07T10:55:44.336377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.986733Z","title":"Unigen: A unified generative framework for retrieval and question answering with large language models","venue":null,"work_id":"7546b036-3e31-4729-a62c-7004640916d5","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.339233Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:5e5c64b282834eb52e43949bb688bfa857e1ba0e10b0a93de464a243b9c71c01","observation_id":"0e2da5ce-f74c-4a6f-a709-c5dff6fbc904","resolution":{"observed_at":"2026-08-07T10:55:44.989911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.977497Z","title":null,"venue":null,"work_id":"de93201d-fbee-42fb-97e6-45fddb07c3dc","year":1996},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.341658Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:2e3f32445294e11aa11a10b7714be0c0de2b828af49ac8fc1a558654f45fe46e","observation_id":"b7fbf1c0-8cf3-49f5-911c-b7e59b01d496","resolution":{"observed_at":"2026-08-07T10:55:44.980324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17382","last_updated":"2024-06-24T05:25:21Z","snapshot_observed_at":"2026-08-03T23:03:20.128765Z","submitted_at":"2023-09-29T16:36:39Z","title":"Reason for Future, Act for Now: A Principled Framework for Autonomous LLM Agents with Provable Sample Efficiency","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17382","snapshot_observed_at":"2026-08-07T10:55:44.457704Z","title":"Reason for future, act for now: A principled framework for autonomous llm agents with provable sample efficiency","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.457704Z"},"links":{"cited_paper":"/paper/2309.17382","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:0e3b90ebf5c564b0839911b7a6d9b30a46c83088e1672693485a8f29ab3ada31","observation_id":"01e787f9-0c88-42d5-a948-b9bf48de9b7d","resolution":{"observed_at":"2026-08-07T10:55:44.457704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.969068Z","title":null,"venue":null,"work_id":"475c1d06-87a4-4186-bf91-3013e1b7343f","year":1963},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.461051Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:08e974446569157e9b0c0726afbc77e274c46e6fd9e52db071b9e62031eac895","observation_id":"2f8d07c3-a60c-4d34-9168-bb15616861af","resolution":{"observed_at":"2026-08-07T10:55:44.971943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.960868Z","title":"Meta llama 3","venue":null,"work_id":"22028402-bb38-4b18-814e-46d5cdeae605","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.463872Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:163af7dabfd8d0ac113fcfb3177339a40a61cb6d1bba87176938c80682c68d96","observation_id":"0ad159a1-a689-4cae-8e10-972e31afba8c","resolution":{"observed_at":"2026-08-07T10:55:44.963613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.952209Z","title":"Meta llama 3.1","venue":null,"work_id":"c553e79a-27f6-4356-86b4-f528724b2db3","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.466393Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:690481dd97b46186f74b4f8b4186b7fef8e7a572aba06be0f385e7f4b63a077d","observation_id":"ed997408-8027-44f6-a260-2ff357ba1bc8","resolution":{"observed_at":"2026-08-07T10:55:44.954996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.943396Z","title":"Augmented language models: a survey","venue":null,"work_id":"b51cb6a0-d2f2-4f3a-a2c1-0506206464b6","year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.469037Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:ebd6e4ddad4311a8153f8f55c9c50d99cb89afb4b2627c6fac79033048847dfc","observation_id":"bd9417d3-9dc8-451f-a888-91afc3a7b70b","resolution":{"observed_at":"2026-08-07T10:55:44.946264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13543","last_updated":"2025-04-01T14:45:22Z","snapshot_observed_at":"2026-08-07T21:22:03.988482Z","submitted_at":"2024-11-20T18:54:32Z","title":"BALROG: Benchmarking Agentic LLM and VLM Reasoning On Games","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13543","snapshot_observed_at":"2026-08-07T10:55:44.471737Z","title":"N., Parker-Holder, J., and Rockt \\\"a schel, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.471737Z"},"links":{"cited_paper":"/paper/2411.13543","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:fc003e82e621ce9dd7d8eca27e59eb47831c5d5e91c310b4e9072019773c1134","observation_id":"163cc2d4-c4e2-49bd-93c3-61050bed5f00","resolution":{"observed_at":"2026-08-07T10:55:44.471737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-07T10:55:44.474500Z","title":"B., Kumar, A., Zhang, G., and Levine, S","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.474500Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:96394c40f9f77dc25fee1ba61afa15fe8537596fee3aaf05cfa2cad3302c0ee9","observation_id":"4a91ba41-5412-4b3a-ba82-1d372584acd4","resolution":{"observed_at":"2026-08-07T10:55:44.474500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.477102Z","title":"and Schaal, S","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.477102Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:cc092517d2cb699ef612e7c1025470d86ed24f994e52d2fcc893378cf909ff29","observation_id":"319de725-a390-4093-921c-24f013875939","resolution":{"observed_at":"2026-08-07T10:55:44.477102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.929094Z","title":"Why think step by step? reasoning emerges from the locality of experience","venue":null,"work_id":"321dac53-18de-428d-aab7-27e11c983869","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.479697Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:17558d7d764312a1813f236e1c39003721d611196f433ef25a678feb025f948a","observation_id":"c34eb28c-b6bf-4581-9945-4535d81cb2d0","resolution":{"observed_at":"2026-08-07T10:55:44.932022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.482320Z","title":"D., Ermon, S., and Finn, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.482320Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:6b091fa5931ea60bd6c34c82b032914db0261abe1d04b4db3bc29886d37f7288","observation_id":"01743166-a593-4771-a463-4a15f7212bfb","resolution":{"observed_at":"2026-08-07T10:55:44.482320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-07T10:55:44.484816Z","title":"E., Adi, Y., Liu, J., Remez, T., Rapin, J., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.484816Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:198a39132a1fb45d48a4cbb4fd467223241288566c14a03161a48d3762a36f02","observation_id":"ea598e5b-acc9-4028-9028-af4d1cf71160","resolution":{"observed_at":"2026-08-07T10:55:44.484816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T10:55:44.487555Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.487555Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:d0a89f7211aba462e2986be6fa381ccfb89b07eb1076c00a226e517f3d704626","observation_id":"8e6f3dd8-db1b-4ce5-a1d0-25429639149e","resolution":{"observed_at":"2026-08-07T10:55:44.487555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.490111Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.490111Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:84dd1496355b71f3e3e0baf5a3b518aff8d756fb4649fca68b309efd75172ebf","observation_id":"e4682510-9830-4f2a-a729-038bd34ddb05","resolution":{"observed_at":"2026-08-07T10:55:44.490111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.909140Z","title":"Alfred: A benchmark for interpreting grounded instructions for everyday tasks","venue":null,"work_id":"92fbbb2d-a090-403e-9b50-f4d2d4ac4d3c","year":2020},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.492701Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:88a03d6a1e9bde69058c0540bf5679b859eb48784e113f79b6582c892356ecf8","observation_id":"11b55e9a-8dea-4083-838c-dd7cd39ad867","resolution":{"observed_at":"2026-08-07T10:55:44.912098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.900256Z","title":"Alfworld: Aligning text and embodied environments for interactive learning, 2021","venue":null,"work_id":"eb6c0a50-55dd-453b-893a-350935f1e9f3","year":2021},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.495003Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:a08b5191a65fe0898957131659d6c863f52dacb41218ae48e129a8a8d4a3b55f","observation_id":"e74a8459-b34b-490b-9a65-a0024ebd13d6","resolution":{"observed_at":"2026-08-07T10:55:44.903299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.497377Z","title":"Progprompt: Generating situated robot task plans using large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.497377Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:659bf018f9c2de5569dfa3cded028bf4bfe9b9c38edc595451c4944ce9e6170e","observation_id":"56c293c6-26b3-47ea-9086-c8aed55075a0","resolution":{"observed_at":"2026-08-07T10:55:44.497377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.885391Z","title":"D., and Toshev, A","venue":null,"work_id":"0148d944-708f-4497-86b6-0dfc4eaddbfd","year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.500183Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:e6e4562b16a91ef624a7d9299b2d9ddfa99e388ee14ff7efff71668650e641f7","observation_id":"17417333-0912-4f74-9e50-becfb8978e61","resolution":{"observed_at":"2026-08-07T10:55:44.888314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.876477Z","title":"True knowledge comes from practice: Aligning large language models with embodied environments via reinforcement learning","venue":null,"work_id":"1f684480-0e2c-469a-b379-4b84596728e7","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.502726Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:47ef2c1dea0cf4c7e95b8398838e232216c66da43bcb4734f6675f71ec40bdf6","observation_id":"61495bfc-42c5-491c-80ea-76d0aeb7f3f2","resolution":{"observed_at":"2026-08-07T10:55:44.879712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-07T10:55:44.505310Z","title":"S., Love, J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.505310Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:9289c2128334f75ccbe56672113912effd6555a7d68c5ed079a91e980e0566bf","observation_id":"ac4d6994-e8ea-49eb-8f2b-cbe00d981b26","resolution":{"observed_at":"2026-08-07T10:55:44.505310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T10:55:44.508021Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.508021Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:8143c531fcffd706838a636e19d688d6c74acf566e63f703c6d55cafad94b598","observation_id":"b02096e9-2c90-4cbc-b0a8-ea3568ddbafb","resolution":{"observed_at":"2026-08-07T10:55:44.508021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.867835Z","title":null,"venue":null,"work_id":"294bf7ab-5ef5-4ff8-adac-453e4de53236","year":1992},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.510775Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:22c1fa87939395d6ab5e387e640d914c604998727140c1e67819a69cecfed660","observation_id":"d73eeb31-a55b-4e02-8247-df8e1f2f7128","resolution":{"observed_at":"2026-08-07T10:55:44.870756Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.513182Z","title":"V., Zhou, D., et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.513182Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:9ac4c7342a87506eaad60fc906f1eef42f6ccfaf62ac300f3263eaf9988f3ea2","observation_id":"c25f6ddd-dc09-48d4-9350-8e3d25bdb74e","resolution":{"observed_at":"2026-08-07T10:55:44.513182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.515658Z","title":"Webshop: Towards scalable real-world web interaction with grounded language agents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.515658Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:be69e0f78ee53d225a1c80954560d4c1361952661fd974717b6b214c095ac066","observation_id":"c8d8e698-062d-48b7-88b1-95778729ebe5","resolution":{"observed_at":"2026-08-07T10:55:44.515658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.518179Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.518179Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:0ab0f60768d9a64c6ccf2f71dbca17d86d04743243d6d28bca82a7320f365fb6","observation_id":"42b7e1e6-0945-4541-b622-0bf63df593cc","resolution":{"observed_at":"2026-08-07T10:55:44.518179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.841600Z","title":"C., Liu, Z., Feng, Y., Xue, L., Rithesh, R., Chen, Z., Zhang, J., Arpit, D., et al","venue":null,"work_id":"01837093-d9df-46dc-8e04-79ee688abbb9","year":null},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.520944Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:8603aa921e69d2c36da0e630592a99510f9580a731cbe654e1ef1cbbf41aea35","observation_id":"64947bb9-e6d6-4e8f-923c-7162fe407f26","resolution":{"observed_at":"2026-08-07T10:55:44.844499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13884","last_updated":"2024-01-23T14:11:04Z","snapshot_observed_at":"2026-07-06T16:51:27.372220Z","submitted_at":"2023-11-23T10:14:58Z","title":"Controlling Large Language Model-based Agents for Large-Scale Decision-Making: An Actor-Critic Approach","version":3},"cited_work":{"arxiv_id":"2311.13884","doi":null,"metadata_source":"pith","pith_arxiv_id":"2311.13884","snapshot_observed_at":"2026-08-07T10:55:44.576047Z","title":"Controlling Large Language Model-based Agents for Large-Scale Decision-Making: An Actor-Critic Approach","venue":"cs.AI","work_id":"9e02567f-7301-447a-b352-6fb6924f6ef0","year":2023},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.523696Z"},"links":{"cited_paper":"/paper/2311.13884","citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:9f8225f32b667f1f162da40a2f1fb045197de9b25397a8bff87da0c42ebe2e4e","observation_id":"472a3cc8-de4a-4b05-8766-b80fb2efa25a","resolution":{"observed_at":"2026-08-07T10:55:44.581052Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.832670Z","title":"Large language models are semi-parametric reinforcement learning agents","venue":null,"work_id":"acfe49e2-47eb-4aca-aec9-b3d81fbbc560","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.526453Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:8156f00cf9beed1ccf4abc6db20b4e85b839173843a74d35cb29860ca2744970","observation_id":"b77abfaa-bc0b-4880-bf6b-be5f5fbb1df1","resolution":{"observed_at":"2026-08-07T10:55:44.835461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.824094Z","title":"Language agent tree search unifies reasoning, acting, and planning in language models","venue":null,"work_id":"fd5823ff-ecbe-419e-baf8-1d592868168a","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.529045Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:00bda3a2a11494d034b4516778540b5b1dd122e9d3be9d9bd231a288389d56af","observation_id":"b27d00e7-f66f-454a-b8f4-507347a539f5","resolution":{"observed_at":"2026-08-07T10:55:44.827040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.815217Z","title":"Archer: Training language model agents via hierarchical multi-turn rl","venue":null,"work_id":"f51b9777-adf3-4046-995c-84d2813b7bf2","year":2024},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.531578Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:b28dfdc778d2f335a2845827ec5f2b4af1fad65382cc9bb8153d356fb0af00ed","observation_id":"1d16ed95-0271-4c05-b3a7-166c87a4cd8f","resolution":{"observed_at":"2026-08-07T10:55:44.818408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:55:44.534042Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T10:55:44.534042Z"},"links":{"citing_paper":"/paper/2506.06376"},"observation_digest":"sha256:72365b5184b616312d3cc9faf9883c31e6f7baabe3a0e8e7e5cd7dd5831a306e","observation_id":"f1c2c3a5-e6c6-4360-8658-418e81908b5b","resolution":{"observed_at":"2026-08-07T10:55:44.534042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.06376","last_updated":"2025-06-04T14:58:27Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T14:58:59.616778Z","submitted_at":"2025-06-04T14:58:27Z","title":"Enhancing Decision-Making of Large Language Models via Actor-Critic"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":2,"verified_fuzzy":26},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2506.06376."}