{"as_of":"2026-08-21T20:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d32d4afd85883b6219df4c25bf293759774532297005610df218da01fc693b93","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:45:01.725671Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.17714/citation-record","integrity":"/paper/2505.17714/integrity","json":"/paper/2505.17714/citation-record.json","paper":"/paper/2505.17714"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:44:59.795938Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:59.795938Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:d14eb710023801c3e504fde5ce476bbf7a01cbecef159f8673925fad37a8bd12","observation_id":"ed48a1ba-0985-4002-8884-99638701bedf","resolution":{"observed_at":"2026-08-07T14:44:59.795938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:06.284278Z","title":"Benchmarking deep reinforcement learning for continuous control,","venue":null,"work_id":"292a0373-fa95-48a9-852d-6f20ee6849b3","year":2016},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:44:59.896292Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:79f6e8b3552c47d68a4572519ee113397d892ac3339ebf7de697f5548db00553","observation_id":"ba071adb-7693-41f6-b689-43307b421dc9","resolution":{"observed_at":"2026-08-07T14:45:06.440862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T14:45:00.026191Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.026191Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:a27b5860820272dd85f8123b97ef37bbb78d8921484d499afa5de3fe02ada101","observation_id":"9fa4db05-1286-48d5-982b-b0542b980360","resolution":{"observed_at":"2026-08-07T14:45:00.026191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:05.948336Z","title":"Discriminator-actor-critic: Addressing sample inefficiency and reward bias in adversarial imitation learning,","venue":null,"work_id":"b39a2d49-a04b-4a3b-abee-03f0331ac47a","year":2021},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.118894Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:b59634b9cbac895d88070c0686c315174e9f4ee58630101dec253a9f8e3bc8dd","observation_id":"aaea74fd-0dfa-4cf0-80f6-8ce220d945b5","resolution":{"observed_at":"2026-08-07T14:45:06.094173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:05.619871Z","title":"Trust region policy optimization,","venue":null,"work_id":"04201ddf-b2f7-4796-8a06-afacd490ecaf","year":2015},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.173993Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:4560c1eaac8e0146aa59ff3bee07218b18ba859342fe956df3bb85bd7dd688e3","observation_id":"af84fa71-8172-418a-a21f-51ccf5973597","resolution":{"observed_at":"2026-08-07T14:45:05.758067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:05.216015Z","title":"Annealed policy optimization for deep reinforcement learning,","venue":null,"work_id":"f23de1e7-9b05-4ea0-a0d7-69d3fc28f387","year":2020},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.226610Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:0fc10de055401ebdc89c1a11483ca6e6cb203dc4511af2a6af67c39a6e58f612","observation_id":"1ea400c7-b34f-496a-8f83-5b92ddac29bc","resolution":{"observed_at":"2026-08-07T14:45:05.421447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:04.909126Z","title":"Understanding the impact of entropy on policy optimization,","venue":null,"work_id":"63c265cb-da8f-4c55-a8b6-ef5e719fee72","year":2019},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.328576Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:ae0c2a82d92f652ad76b0a74d3397b94b62582da2f702d0e495bf9bec5ce6dc8","observation_id":"e826bed6-4128-40b3-8976-794773bad0f1","resolution":{"observed_at":"2026-08-07T14:45:05.066997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:04.576743Z","title":"Normalized policy gradients for reinforcement learning,","venue":null,"work_id":"69435361-04ae-46cd-8d7c-f91326b5408c","year":2018},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.425882Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:1947b874fa4b4ad8c6bc7db1951ccffcdb2180e8324a7be7553812cc8235f822","observation_id":"9f4fba45-8f02-4dd0-a811-d838d83d1529","resolution":{"observed_at":"2026-08-07T14:45:04.720748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:04.299690Z","title":"Sutton and A","venue":null,"work_id":"279020ee-aaa0-4149-8f6b-136223f4ba0f","year":2018},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.489904Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:fde0ab1de56c0f9d36de0a4785b5e7d1603d4e2d7a1d2c662a6c85cfc1ee9ca0","observation_id":"d435a8a6-a97a-4815-8819-1cf31dee32e2","resolution":{"observed_at":"2026-08-07T14:45:04.445147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:03.997383Z","title":"Reinforcement learning: A survey,","venue":null,"work_id":"f6d7e5df-60ef-4bf2-a33a-dbef86509781","year":1996},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.593465Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:cbf26dd7ea0ab7ecad657afadcb15218da48ed075b33a06854e19a0d4a2fe96c","observation_id":"db774f95-8495-4d18-87a8-156d86dc4837","resolution":{"observed_at":"2026-08-07T14:45:04.108939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:03.769690Z","title":"Simple statistical gradient-following algorithms for connectionist reinforcement learning,","venue":null,"work_id":"9956aa08-1dcf-45a4-9de7-b28bf70e43af","year":1992},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.667690Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:00795fb872f4fa24ef99f4a51db5fbf2c1e14862f9d5c821a54e550a80968fe1","observation_id":"49f59f67-a684-43b3-9e07-d88295652ad2","resolution":{"observed_at":"2026-08-07T14:45:03.861939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:03.552166Z","title":"High-dimensional continuous control using generalized advantage estimation,","venue":null,"work_id":"fc91341f-b582-4d83-b3d5-ad29a35af868","year":2016},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.768484Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:89a334ae2eb9ca8f71a3812dcfbed36835c1ee08980eee7e885eb5feb654bb84","observation_id":"ce536db6-f0aa-47ec-bbae-acfece1719f7","resolution":{"observed_at":"2026-08-07T14:45:03.634034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:03.216597Z","title":"Grandmaster level in StarCraft II using multi-agent reinforcement learning,","venue":null,"work_id":"ccb583e4-796a-4fd5-9d6c-ea94a83ebacb","year":2019},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:00.891898Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:268c0ca878c7510ed565dbcf55896d36a63eb20fb8e02332b33efabcd754b400","observation_id":"350014f5-19c8-4dc2-b356-18a77b7a37c4","resolution":{"observed_at":"2026-08-07T14:45:03.466030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:03.024953Z","title":"Annealed policy optimization,","venue":null,"work_id":"5d8e07ae-fcb0-485f-8eb4-ff546558db94","year":2020},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:01.006215Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:d436f0f35eae09675358e432f69adb0098284be998c911b65c6192c96a328561","observation_id":"7dc67ac9-c92c-44ff-88af-46b978cdf3e7","resolution":{"observed_at":"2026-08-07T14:45:03.117391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:02.752826Z","title":"Noisy networks for exploration,","venue":null,"work_id":"57b64826-2268-43cf-a79b-c088cd69752e","year":2018},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:01.112097Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:e56349e214e072bf998cb1f31ead7350d1157da35a36c3e6afc5a09241126f75","observation_id":"f77c92cb-f40a-42c5-b9bd-a3ef5461038d","resolution":{"observed_at":"2026-08-07T14:45:02.878463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2016.25826","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:02.152189Z","title":"Deep Reinforcement Learning: An Overview,","venue":null,"work_id":"2b4c2b74-ec24-4a91-a04b-910508b2a9ee","year":2017},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:01.223279Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:7f38ee57d450fcfb71f3467c3de929a3a2def4e9b21106288f103d39eefe9b31","observation_id":"725dfd50-53b0-4a33-abe4-67a6f5dbd49b","resolution":{"observed_at":"2026-08-07T14:45:02.226161Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:02.534676Z","title":"Constrained Policy Optimization,","venue":null,"work_id":"8a5c0b3a-17c8-4f99-9656-18d9ef77bb40","year":2017},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:01.373170Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:72341334bbdbc7366b6411ffe3e31e907873b27327cab51f95002ad100987e49","observation_id":"5a5b95cf-715c-4aaf-8a2d-a4aa84a5f2d4","resolution":{"observed_at":"2026-08-07T14:45:02.628187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:02.337038Z","title":"A Study on Overfitting in Deep Reinforcement Learning,","venue":null,"work_id":"f71e8fba-4e00-40cc-b438-b55d90b0831a","year":2018},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:01.506161Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:c329465180931932bab2d6874175395b6935662de6fc5eb53e042e2be3227a47","observation_id":"6e852697-3be3-4650-a1f9-4a74d4c7c120","resolution":{"observed_at":"2026-08-07T14:45:02.404638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:45:01.598606Z","title":"Optimizing Customer Satisfaction Through Sentiment Analysis: A BERT-Based Machine Learning Approach to Extract Insights,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:01.598606Z"},"links":{"citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:d941d911532cf33698a1b3395845e4b142ce4653139698ec64fba62c64320c46","observation_id":"b155d807-98c2-4b2d-967a-679e0e6b73db","resolution":{"observed_at":"2026-08-07T14:45:01.598606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19276","last_updated":"2025-03-25T02:12:35Z","snapshot_observed_at":"2026-08-19T10:13:59.204476Z","submitted_at":"2025-03-25T02:12:35Z","title":"Context-Aware Semantic Segmentation: Enhancing Pixel-Level Understanding with Large Language Models for Advanced Vision Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19276","snapshot_observed_at":"2026-08-07T14:45:01.725671Z","title":"Context -Aware Semantic Segmentation: Enhancing Pixel -Level Understanding with Large Language Models for Advanced Vision Applications,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:45:01.725671Z"},"links":{"cited_paper":"/paper/2503.19276","citing_paper":"/paper/2505.17714"},"observation_digest":"sha256:d12c74d8966c7970c80bef688856102896a3b165d0df4f2c75ab17fd886bbcac","observation_id":"ec1f8a1a-a535-4f03-9ffd-7d932f0ab305","resolution":{"observed_at":"2026-08-07T14:45:01.725671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.17714","last_updated":"2025-05-23T10:30:58Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-19T10:14:20.007177Z","submitted_at":"2025-05-23T10:30:58Z","title":"PPO-BR: Dual-Signal Entropy-Reward Adaptation for Trust Region Policy Optimization"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":4,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2505.17714."}