{"as_of":"2026-08-10T06:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b138a6c11ea6800e3182d5b45fb43d84d4f51087ecb2ad3f2e068da63b54679f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T12:34:10.669711Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":39,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1909.12238","last_updated":"2019-09-26T16:34:22Z","snapshot_observed_at":"2026-07-31T01:38:27.388070Z","submitted_at":"2019-09-26T16:34:22Z","title":"V-MPO: On-Policy Maximum a Posteriori Policy Optimization for Discrete and Continuous Control","version":1},"cited_work":{"arxiv_id":"1909.12238","doi":"10.48550/arxiv.1909.12238","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.12238","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.12238 , year=","venue":"arXiv (Cornell University)","work_id":"8e33f22b-48f5-4ba7-afd6-eab69f276509","year":1909},"citing_paper":{"arxiv_id":"2209.14375","last_updated":"2022-09-28T19:04:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-28T19:04:43Z","title":"Improving alignment of dialogue agents via targeted human judgements","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-14T17:54:02.217086Z"},"links":{"cited_paper":"/paper/1909.12238","citing_paper":"/paper/2209.14375"},"observation_digest":"sha256:b248681b665b9e70fd72ae522a2c4b2c364ec3b13cb3896ec01e3c55679d2b49","observation_id":"4debb08a-1c94-4462-82f0-c91fa6b6f80d","resolution":{"observed_at":"2026-05-14T17:54:02.295634Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12238","last_updated":"2019-09-26T16:34:22Z","snapshot_observed_at":"2026-07-31T01:38:27.388070Z","submitted_at":"2019-09-26T16:34:22Z","title":"V-MPO: On-Policy Maximum a Posteriori Policy Optimization for Discrete and Continuous Control","version":1},"cited_work":{"arxiv_id":"1909.12238","doi":"10.48550/arxiv.1909.12238","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.12238","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.12238 , year=","venue":"arXiv (Cornell University)","work_id":"8e33f22b-48f5-4ba7-afd6-eab69f276509","year":1909},"citing_paper":{"arxiv_id":"2309.16797","last_updated":"2023-09-28T19:01:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T19:01:07Z","title":"Promptbreeder: Self-Referential Self-Improvement Via Prompt Evolution","version":1},"reference_index":299,"source":"arxiv_source","source_observed_at":"2026-05-16T08:12:30.984870Z"},"links":{"cited_paper":"/paper/1909.12238","citing_paper":"/paper/2309.16797"},"observation_digest":"sha256:82f08a0f4b9cd996b658a41b54362c08e1593ec50f6a83e6681d2023bff271b1","observation_id":"f30a9262-2c2d-4d6c-b07d-5a5eaaed3143","resolution":{"observed_at":"2026-05-16T08:12:31.230429Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12238","last_updated":"2019-09-26T16:34:22Z","snapshot_observed_at":"2026-07-31T01:38:27.388070Z","submitted_at":"2019-09-26T16:34:22Z","title":"V-MPO: On-Policy Maximum a Posteriori Policy Optimization for Discrete and Continuous Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.12238","snapshot_observed_at":"2026-08-09T12:34:10.669711Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.02377","last_updated":"2025-02-04T14:57:54Z","snapshot_observed_at":"2026-08-10T05:20:17.164219Z","submitted_at":"2025-02-04T14:57:54Z","title":"A Minimax Approach to Ad Hoc Teamwork","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T12:34:10.669711Z"},"links":{"cited_paper":"/paper/1909.12238","citing_paper":"/paper/2502.02377"},"observation_digest":"sha256:b8cc416dc4d26eb3ecf3f9c88c3923b941b714797da477db7cca58556f659493","observation_id":"796390f8-dc85-4807-a755-37736bb04756","resolution":{"observed_at":"2026-08-09T12:34:10.669711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12238","last_updated":"2019-09-26T16:34:22Z","snapshot_observed_at":"2026-07-31T01:38:27.388070Z","submitted_at":"2019-09-26T16:34:22Z","title":"V-MPO: On-Policy Maximum a Posteriori Policy Optimization for Discrete and Continuous Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.12238","snapshot_observed_at":"2026-08-07T11:22:12.160191Z","title":"Francis Song, Abbas Abdolmaleki, Jost Tobias Springenberg, Aidan Clark, Hubert Soyer, Jack W","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.03225","last_updated":"2025-07-17T15:41:03Z","snapshot_observed_at":"2026-08-10T02:50:48.291949Z","submitted_at":"2025-06-03T11:19:21Z","title":"Multiple-Frequencies Population-Based Training","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:22:12.160191Z"},"links":{"cited_paper":"/paper/1909.12238","citing_paper":"/paper/2506.03225"},"observation_digest":"sha256:89399d5140bd6780dca04441120b78c9da8a1db04d1c558ec6be279a2133be5c","observation_id":"51e6b5d6-6b16-4642-8a87-d472fa8029d2","resolution":{"observed_at":"2026-08-07T11:22:12.160191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12238","last_updated":"2019-09-26T16:34:22Z","snapshot_observed_at":"2026-07-31T01:38:27.388070Z","submitted_at":"2019-09-26T16:34:22Z","title":"V-MPO: On-Policy Maximum a Posteriori Policy Optimization for Discrete and Continuous Control","version":1},"cited_work":{"arxiv_id":"1909.12238","doi":"10.48550/arxiv.1909.12238","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.12238","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.12238 , year=","venue":"arXiv (Cornell University)","work_id":"8e33f22b-48f5-4ba7-afd6-eab69f276509","year":1909},"citing_paper":{"arxiv_id":"2605.06139","last_updated":"2026-05-20T08:43:26Z","snapshot_observed_at":"2026-08-03T23:49:55.614451Z","submitted_at":"2026-05-07T12:38:17Z","title":"Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-08T13:55:22.422923Z"},"links":{"cited_paper":"/paper/1909.12238","citing_paper":"/paper/2605.06139"},"observation_digest":"sha256:d6a6f8ff19c83734f2fe8e2824ee7250e14c2d44186e5e5768eed3cdcbf4f4e1","observation_id":"c6cc8c3f-608c-48a1-b990-c82fdc6ef923","resolution":{"observed_at":"2026-05-11T18:46:10.322410Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12238","last_updated":"2019-09-26T16:34:22Z","snapshot_observed_at":"2026-07-31T01:38:27.388070Z","submitted_at":"2019-09-26T16:34:22Z","title":"V-MPO: On-Policy Maximum a Posteriori Policy Optimization for Discrete and Continuous Control","version":1},"cited_work":{"arxiv_id":"1909.12238","doi":"10.48550/arxiv.1909.12238","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.12238","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.12238 , year=","venue":"arXiv (Cornell University)","work_id":"8e33f22b-48f5-4ba7-afd6-eab69f276509","year":1909},"citing_paper":{"arxiv_id":"2605.06139","last_updated":"2026-05-20T08:43:26Z","snapshot_observed_at":"2026-08-03T23:49:55.614451Z","submitted_at":"2026-05-07T12:38:17Z","title":"Listwise Policy Optimization: Group-based RLVR as Target-Projection on the LLM Response Simplex","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-21T09:02:28.407064Z"},"links":{"cited_paper":"/paper/1909.12238","citing_paper":"/paper/2605.06139"},"observation_digest":"sha256:472906e90d6dd079211aa42727ef2d54035c4962f2ab332069a9c28f05ec5625","observation_id":"d1786848-5e9b-4e83-89f9-627c49c605bc","resolution":{"observed_at":"2026-05-21T09:04:04.534726Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12238","last_updated":"2019-09-26T16:34:22Z","snapshot_observed_at":"2026-07-31T01:38:27.388070Z","submitted_at":"2019-09-26T16:34:22Z","title":"V-MPO: On-Policy Maximum a Posteriori Policy Optimization for Discrete and Continuous Control","version":1},"cited_work":{"arxiv_id":"1909.12238","doi":"10.48550/arxiv.1909.12238","metadata_source":"arxiv_reference","pith_arxiv_id":"1909.12238","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:1909.12238 , year=","venue":"arXiv (Cornell University)","work_id":"8e33f22b-48f5-4ba7-afd6-eab69f276509","year":1909},"citing_paper":{"arxiv_id":"2605.26784","last_updated":"2026-05-26T09:53:42Z","snapshot_observed_at":"2026-08-06T13:00:03.980604Z","submitted_at":"2026-05-26T09:53:42Z","title":"Ratio-Variance Regularized Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T19:44:02.317303Z"},"links":{"cited_paper":"/paper/1909.12238","citing_paper":"/paper/2605.26784"},"observation_digest":"sha256:d21591fcb9e1214c3c530b13cdb6e63485e10a64249a987de7af15942e5bddf6","observation_id":"f108616f-79d7-43ac-adf5-b3c5c05d03dc","resolution":{"observed_at":"2026-06-29T19:53:55.936626Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1909.12238/citation-record","integrity":"/paper/1909.12238/integrity","json":"/paper/1909.12238/citation-record.json","paper":"/paper/1909.12238"},"outbound":[],"paper":{"arxiv_id":"1909.12238","last_updated":"2019-09-26T16:34:22Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-31T01:38:27.388070Z","submitted_at":"2019-09-26T16:34:22Z","title":"V-MPO: On-Policy Maximum a Posteriori Policy Optimization for Discrete and Continuous Control"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:1909.12238."}