{"as_of":"2026-08-18T22:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f14fca69334f7bfe1c2122a3a42e4c9b1fcab756a592a533a99e8bdcdd7a1f27","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:54:26.316448Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T11:44:53.211503Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T01:36:25.635046Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.01261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01261","snapshot_observed_at":"2026-07-02T01:36:25.635046Z","title":"Xie and S","venue":null,"work_id":"c1f924e3-6530-4ee1-8a49-abe540fb26b7","year":2025},"citing_paper":{"arxiv_id":"2605.14423","last_updated":"2026-05-14T06:10:31Z","snapshot_observed_at":"2026-08-12T22:45:35.081268Z","submitted_at":"2026-05-14T06:10:31Z","title":"Collaborative Yet Personalized Policy Training: Single-Timescale Federated Actor-Critic","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-15T02:07:23.862809Z"},"links":{"cited_paper":"/paper/2506.01261","citing_paper":"/paper/2605.14423"},"observation_digest":"sha256:7edf27af38ec2af2aa138efef2b1cef55b63149032fed5d30151afe6b82be043","observation_id":"b32d63e9-5e95-4638-a392-534a5ecc3069","resolution":{"observed_at":"2026-05-15T02:08:29.340835Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2506.01261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01261","snapshot_observed_at":"2026-07-02T01:36:25.635046Z","title":"Xie and S","venue":null,"work_id":"c1f924e3-6530-4ee1-8a49-abe540fb26b7","year":2025},"citing_paper":{"arxiv_id":"2606.03094","last_updated":"2026-06-02T03:32:32Z","snapshot_observed_at":"2026-08-13T03:32:17.136484Z","submitted_at":"2026-06-02T03:32:32Z","title":"FGRPO: Federated GRPO with Adaptive Aggregation on Non-IID Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T11:44:53.211503Z"},"links":{"cited_paper":"/paper/2506.01261","citing_paper":"/paper/2606.03094"},"observation_digest":"sha256:629817385af6f66d165941cf7558ceab863736ad82c94a88c437e6e988db1afd","observation_id":"1377c879-6903-497f-b020-dba0efa9ead2","resolution":{"observed_at":"2026-07-02T01:36:25.637603Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01261/citation-record","integrity":"/paper/2506.01261/integrity","json":"/paper/2506.01261/citation-record.json","paper":"/paper/2506.01261"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:31.988023Z","title":"Fitted q-iteration in continuous action-space mdps","venue":null,"work_id":"6d282922-655d-4a98-9fb7-0a67cb153705","year":2007},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.122203Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:9e49860c5597e70d7e310e70d55eb483f6b2f72917fb17c9041389777f3014e2","observation_id":"f866580d-3a6a-4ac7-b845-022d9dddbfc3","resolution":{"observed_at":"2026-08-07T11:54:32.085703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:23.284017Z","title":"S., and Guin, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.284017Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:ab193291eb476cbfbf42e753a51019c0d3ec2b537ea53aa287cb40c23fd6193e","observation_id":"7ad5d9ca-845d-4ea8-8c06-04e49da4417b","resolution":{"observed_at":"2026-08-07T11:54:23.284017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-13T12:26:05.192883Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-07T11:54:23.368455Z","title":"Openai gym","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.368455Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:6e721183cd5d262e607b32a4b61faef9a0aa84e2fca1e38bbad104454792e4bc","observation_id":"c672ef05-d8e8-4300-b67b-2cfaae3b0fc8","resolution":{"observed_at":"2026-08-07T11:54:23.368455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:31.798000Z","title":"D., and Wang, Z","venue":null,"work_id":"c8299a18-4b03-4f80-af96-7c2e554e6c0f","year":2019},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.514345Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:99bd01b717dc59977d4ebff9978ae5d96ce08bde8cfe4afb4251289e1f3a31d0","observation_id":"c7cacfe5-bcd0-4e18-b0f7-f160f1699d2f","resolution":{"observed_at":"2026-08-07T11:54:31.888111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:31.528949Z","title":"W., Hilton, J., Klimov, O., and Schulman, J","venue":null,"work_id":"7d1cb47b-b9ba-4992-8c21-dfa033ca0717","year":2020},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.606041Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:30d3c28e86facfaf06a5a15679772ec206d83d1be90e6648c7970efe4adfbe28","observation_id":"c8deb5e1-1c7a-4d43-b690-9ae93ad6d974","resolution":{"observed_at":"2026-08-07T11:54:31.641212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:31.358189Z","title":"Linear off-policy actor-critic","venue":null,"work_id":"fe8d169b-d094-4f40-afa7-e68ace18364c","year":2012},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.695877Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:15e54087ef859727e38a7ea5b48460d1774c6fd67f83276ddb0d028ad5de0460","observation_id":"300c19b8-a938-4320-b4dd-c41e32cb8cff","resolution":{"observed_at":"2026-08-07T11:54:31.431771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:31.142074Z","title":"A theoretical analysis of deep q-learning","venue":null,"work_id":"3e4e6c35-0eff-49a5-aa7d-dc10556a3073","year":2020},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.790666Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:68a995ba96771af46013e0e9ff4f3246e71bbdd37b77aa3fa63ee59efe1150ce","observation_id":"c0ff3ad0-e46a-4700-a7cc-47aed292b5ad","resolution":{"observed_at":"2026-08-07T11:54:31.246319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:30.926063Z","title":null,"venue":null,"work_id":"f8047f96-846b-4de5-a299-90cd599f0e46","year":2021},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.873294Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:5d29939dc8e3ebc8075339c1369098a4362aae2b7b7b03357541b9f5371dced3","observation_id":"3a257f89-2ad1-41ae-9a14-5468bd6c9ba5","resolution":{"observed_at":"2026-08-07T11:54:31.047177Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:30.787355Z","title":"Error propagation for approximate policy and value iteration","venue":null,"work_id":"5daae06a-e29a-4904-a612-f316798f70a4","year":2010},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:23.956416Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:e4d17275ad8b7da3dc02b66d5d12cda3b51b4c7a92b30936234d1e83c48129a7","observation_id":"2e2979de-4976-4bf6-87ac-ef722abf575a","resolution":{"observed_at":"2026-08-07T11:54:30.864069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:30.588820Z","title":"Reinforcement learning with deep energy- based policies","venue":null,"work_id":"21ca7958-9778-4426-a0c2-0501f59db4c2","year":2017},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.009912Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:15aa3b82ada1fd4a3eab5053065d2fe751f8268f8879e31cae195c1f895bba69","observation_id":"8dbfb1cd-09cf-482d-acd3-d80dfdbb919e","resolution":{"observed_at":"2026-08-07T11:54:30.668546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:30.350006Z","title":"Federated reinforcement learning with environment heterogeneity","venue":null,"work_id":"2a53391e-0be0-4a89-9abe-1a4d66025c09","year":2022},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.059749Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:900e3bea7b5fec4ae5db266dcf2e2eb94bd2c455e2b10dbf927500449886f4b7","observation_id":"358e5bf4-13f5-43e1-9ef0-c75e466949be","resolution":{"observed_at":"2026-08-07T11:54:30.469003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:30.137312Z","title":"P., Kale, S., Mohri, M., Reddi, S., Stich, S., and Suresh, A","venue":null,"work_id":"01882cf8-6ceb-4487-83c5-6a6cb4ee1c17","year":2020},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.138911Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:d103479003cc8eef08567c920d8eb1c79360146cac0d75b24f2688cfdf3a3931","observation_id":"12327596-a491-4a38-8cb4-3196ee54b005","resolution":{"observed_at":"2026-08-07T11:54:30.225430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:29.904731Z","title":"and Tsitsiklis, J","venue":null,"work_id":"c92d52d0-9600-43bf-9e1e-7e584e6511a3","year":1999},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.191908Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:ac12fdec70e72b4f866579709daaf05a07719e5edfb097a4b65836d556af671b","observation_id":"66c651a9-28fd-4962-84c3-d6b1b7bb6311","resolution":{"observed_at":"2026-08-07T11:54:30.016740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:29.700222Z","title":"K., Zaheer, M., Sanjabi, M., Talwalkar, A., and Smith, V","venue":null,"work_id":"bcccc78d-c9c6-41b2-ad52-d8de68e5b54f","year":2020},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.283564Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:984ccb599557a8e8b808ec1846b7da734145b5b01047d3196babd2cea4b1d703","observation_id":"ba962be4-b9d1-4ccc-86b7-75adc426ddac","resolution":{"observed_at":"2026-08-07T11:54:29.781855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:29.455161Z","title":"On the convergence of fedavg on non-iid data","venue":null,"work_id":"2412574e-c49e-4014-9739-0737c26de80b","year":2020},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.398859Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:5ad854de95e55c5beb205b7d9a1aab1a8274aa521d17bd89b2b70223f9c0a70c","observation_id":"a6420aa0-3851-418a-b662-b8c9ab552015","resolution":{"observed_at":"2026-08-07T11:54:29.555582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:29.263622Z","title":"Neural trust region/proximal policy optimization attains globally optimal policy","venue":null,"work_id":"d0c3680f-b364-4e87-a31f-7bc353ce0c00","year":2019},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.532711Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:16e785c075f2a20422e45f2bbcf11e6e8c7c2c2e6dcd71c6e130a7e9f05aa309","observation_id":"34a3dda1-b350-45d5-bab2-6d89dd56ba48","resolution":{"observed_at":"2026-08-07T11:54:29.346041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:29.069468Z","title":null,"venue":null,"work_id":"62df2139-9821-4a69-96cf-1b3d7e3cbdd1","year":2017},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.593013Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:786809c4fbb6455048869f0ab46a8f8bf5847d5a6f1a749ce1d9c0ce696fa7c3","observation_id":"65f24c31-4e0e-473a-ab9e-ebeb3b62479b","resolution":{"observed_at":"2026-08-07T11:54:29.152442Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:28.868544Z","title":"On the global convergence rates of softmax policy gradient methods","venue":null,"work_id":"7d7e6474-671d-40e4-968f-2bc3ad01babb","year":2020},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.703231Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:98855b1542d03e964f0bf7a7ae537c7ae20600bb889b6f5a9e0571367f0e7397","observation_id":"709cd9a4-1602-451f-85c3-1e542b3155fc","resolution":{"observed_at":"2026-08-07T11:54:28.968600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:28.683114Z","title":"A., Veness, J., Bellemare, M","venue":null,"work_id":"e17a8c62-4780-426b-a950-a225f628311e","year":2015},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.807776Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:743d4453b16ddcf4a3e9b36eedd6f80b4703645352a9a5285f04f7ea1f640b9f","observation_id":"b5d387ed-4cd7-43e2-8d98-86763ca50cc6","resolution":{"observed_at":"2026-08-07T11:54:28.764589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:28.510626Z","title":"and Szepesvári, C","venue":null,"work_id":"2df6d313-87e2-4501-b40e-cf25709c761e","year":2008},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:24.918651Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:863881d945da9af5f57c8a2d644b85ce834570f9898b91d3ed163721d35d98ff","observation_id":"29a9c553-d78e-438d-bf62-611abe8ae074","resolution":{"observed_at":"2026-08-07T11:54:28.584788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:28.306825Z","title":"Planet dump retrieved from https://planet.osm.org","venue":null,"work_id":"df5c1e14-5346-4d25-a656-3b220c03b6b6","year":2017},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.028428Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:e3904d9a521d056ae85a8514d614918faf1656dda43c700686ac340c8bef3d30","observation_id":"9718f0b3-1123-4839-9bce-329c0def2396","resolution":{"observed_at":"2026-08-07T11:54:28.421351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-08-15T12:05:11.299477Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-08-07T11:54:25.098661Z","title":"I., and Abbeel, P","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.098661Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:744ec1d352a9145ef8b7a77dfe700f19d2ae73d55ab4d6243598a546e7c2b909","observation_id":"12f480a1-5c6c-4313-b891-fa47167bf3b7","resolution":{"observed_at":"2026-08-07T11:54:25.098661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T11:54:25.165690Z","title":"Proximal policy optimiza- tion algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.165690Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:81ac911ce7e196fad53c1a15835c88b35a507b862399f5ab2e3c3c0a54947b8a","observation_id":"9292f581-f4b7-4a79-858f-3cf4e5080240","resolution":{"observed_at":"2026-08-07T11:54:25.165690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:28.098582Z","title":null,"venue":null,"work_id":"0823f82a-a138-41ba-9afc-81069569de5b","year":1988},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.271960Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:4edf092c1a0557a5b8af65bd2877b56cb8925ca908f9ace74ff1a61e6975f52b","observation_id":"12536ad8-a079-4510-876b-58edb0fc1fb0","resolution":{"observed_at":"2026-08-07T11:54:28.208016Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:27.893541Z","title":"S., McAllester, D., Singh, S., and Mansour, Y","venue":null,"work_id":"9c7a3e5b-3ca4-4ef2-af43-595858041190","year":2000},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.369311Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:f8f3cba510e908cbf18e5c224f9ee100abf8fee2bf501a6780997a0f89a66d2a","observation_id":"54b8813e-da05-4c67-8138-8a79fcc5c049","resolution":{"observed_at":"2026-08-07T11:54:27.978909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:27.697497Z","title":"Boosted fitted q-iteration","venue":null,"work_id":"e94f7587-cf76-42fb-bf58-9a49cf0991d0","year":2017},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.449432Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:1a18341959ce7980cd3165496c3a06f83a66fe24886ff734690c4f5dc352782b","observation_id":"fd1f72d0-98e4-4f32-9d04-6696078872f9","resolution":{"observed_at":"2026-08-07T11:54:27.778136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:25.514852Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.514852Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:88790f44a2de3f91d030ade8574977d29fbb3edd8863b127e2f88c70916cf7db","observation_id":"5eb2fc9f-e882-4ecd-927b-9ba6abec0656","resolution":{"observed_at":"2026-08-07T11:54:25.514852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.29941","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:26.900813Z","title":"E., Srivastava, S., Tuia, D., and Falcão, A","venue":null,"work_id":"ecfd7eb0-15fb-4d35-9106-a0bbcbee50c2","year":2021},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.614183Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:2b92a60ae78e0d0e6a21d30f0e21635928dcbb78acbac052fc030b75ab59b6f6","observation_id":"014e2b7f-8963-441d-95b9-07541ce6162d","resolution":{"observed_at":"2026-08-07T11:54:26.944638Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:27.501269Z","title":"L., Kheterpal, N., Jang, K., Wu, C., Wu, F., Liaw, R., Liang, E., and Bayen, A","venue":null,"work_id":"02c93652-ee7b-4ea7-a4e0-e7ca7f6bfe31","year":2018},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.722659Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:e1d0e66f31a9ffcacb480637858949dcd5f4cefec7dd6b1976e8022f2c9825a1","observation_id":"27b574ad-db67-4b56-b86b-4083bd2da289","resolution":{"observed_at":"2026-08-07T11:54:27.583825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01150","last_updated":"2019-11-12T21:42:43Z","snapshot_observed_at":"2026-08-15T10:56:00.207708Z","submitted_at":"2019-08-29T15:38:19Z","title":"Neural Policy Gradient Methods: Global Optimality and Rates of Convergence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01150","snapshot_observed_at":"2026-08-07T11:54:25.833975Z","title":"Neural policy gradient methods: Global optimality and rates of convergence","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.833975Z"},"links":{"cited_paper":"/paper/1909.01150","citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:37afb5d07f5bff3529db5443c305ff6a92eb29a5ec64d77d02eea44a18ba4c4b","observation_id":"935a9aa8-71f1-4b99-8138-d8b4689fdcc5","resolution":{"observed_at":"2026-08-07T11:54:25.833975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:27.299297Z","title":"P., and Kakade, S","venue":null,"work_id":"eec04142-1d1f-4910-93c6-7ceb74a7122a","year":2020},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:25.909375Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:18b70a6445afa044eb8b4730f24610f51978dbf214a83052a492037214d58556","observation_id":"98bad912-d5dd-449b-b01d-99871ff1812b","resolution":{"observed_at":"2026-08-07T11:54:27.391913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.32427","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:26.590322Z","title":"and Song, S","venue":null,"work_id":"7be50169-5ca4-4902-8b34-7a74e2fd2f90","year":2023},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:26.039203Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:519df3c055e98a6eac133a02232332f698e4f7c26095d773c2deac06c68399c1","observation_id":"39660861-fed3-4826-b7ea-26838d4e7be3","resolution":{"observed_at":"2026-08-07T11:54:26.697142Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.06210","last_updated":"2019-03-04T18:32:17Z","snapshot_observed_at":"2026-08-14T17:43:16.410607Z","submitted_at":"2018-12-15T00:32:09Z","title":"A General Approach to Adding Differential Privacy to Iterative Training Procedures","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.06210","snapshot_observed_at":"2026-08-07T11:54:26.115849Z","title":"and Song, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:26.115849Z"},"links":{"cited_paper":"/paper/1812.06210","citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:9d6b4089e5a74d8f32f163e95272744ddc5d12f7f58fcbe4ba1f12c8d1ce5822","observation_id":"8b3badc4-4a1d-4f43-83be-6a93508fab2d","resolution":{"observed_at":"2026-08-07T11:54:26.115849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:54:27.115384Z","title":"Federated natural policy gradient and actor critic methods for multi-task reinforcement learning","venue":null,"work_id":"76962b10-778b-411d-8ca3-67470028e41c","year":2024},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:26.220188Z"},"links":{"citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:a6cfe635a432c702edfa4f0c3c5ca3f11805d138dc4f3278a7537bad2a3d9ddc","observation_id":"852b693b-da84-4ba9-8f6e-ee8146aed99f","resolution":{"observed_at":"2026-08-07T11:54:27.168863Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.00582","last_updated":"2022-07-21T12:33:15Z","snapshot_observed_at":"2026-08-15T04:44:38.370440Z","submitted_at":"2018-06-02T04:45:58Z","title":"Federated Learning with Non-IID Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.00582","snapshot_observed_at":"2026-08-07T11:54:26.316448Z","title":"Qwt i (s, a) − ρπ∗,i(s) Zπ∗ (s) Qπθt i (s, a) 2# . By the fact that (a + b)2 ≤ 2a2 + 2b2 and ab − cd = a(b − d) + d(a − c), we have Es∼ρπθt ,n,a∼πθt","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:26.316448Z"},"links":{"cited_paper":"/paper/1806.00582","citing_paper":"/paper/2506.01261"},"observation_digest":"sha256:951de559dc0f294a7916f13ce7c325f02d3dee084c8ef2d3d95773c5bf6b63c5","observation_id":"722dd00c-e413-424a-b058-98232ef9a157","resolution":{"observed_at":"2026-08-07T11:54:26.316448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01261","last_updated":"2025-06-02T02:20:22Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T23:40:32.599152Z","submitted_at":"2025-06-02T02:20:22Z","title":"The Actor-Critic Update Order Matters for PPO in Federated Reinforcement Learning"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 2 inbound Pith citation observations for arXiv:2506.01261."}