{"as_of":"2026-08-19T11:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f7f26e5ae849bfe28d9713c603b01f30e60937b61964207e3a705bd51e0779f","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T14:19:51.917733Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:21:33.975739Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-15T15:02:45.745385Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"cited_work":{"arxiv_id":"2502.01876","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.01876","snapshot_observed_at":"2026-08-15T15:02:45.745385Z","title":"Reinforcement Learning with Segment Feedback","venue":"cs.LG","work_id":"866c8f08-455b-4b4d-a561-be944139224d","year":2025},"citing_paper":{"arxiv_id":"2608.02951","last_updated":"2026-08-03T23:28:06Z","snapshot_observed_at":"2026-08-19T00:16:24.852363Z","submitted_at":"2026-08-03T23:28:06Z","title":"SP3O: Reinforcement Learning from Segment Preferences without Reward Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:02:45.617996Z"},"links":{"cited_paper":"/paper/2502.01876","citing_paper":"/paper/2608.02951"},"observation_digest":"sha256:164cc03ea2e365fcb82a3a752c7eeda747f3daac90e6426701145cdc9a870446","observation_id":"2f6a9377-259a-45e1-9173-21492ddfe58f","resolution":{"observed_at":"2026-08-15T15:02:45.752291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01876","snapshot_observed_at":"2026-08-15T18:21:33.975739Z","title":"arXiv preprint arXiv:2502.01876 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13026","last_updated":"2026-08-13T09:54:14Z","snapshot_observed_at":"2026-08-17T10:59:38.876278Z","submitted_at":"2026-08-13T09:54:14Z","title":"Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T18:21:33.975739Z"},"links":{"cited_paper":"/paper/2502.01876","citing_paper":"/paper/2608.13026"},"observation_digest":"sha256:cccf4edf4bed92053b3a21c40fc3d21fafbc254c1af0207a0427bc4932450994","observation_id":"e5a35949-7b26-4bf3-b165-64b8ebb71333","resolution":{"observed_at":"2026-08-15T18:21:33.975739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.01876/citation-record","integrity":"/paper/2502.01876/integrity","json":"/paper/2502.01876/citation-record.json","paper":"/paper/2502.01876"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.837280Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.837280Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:2100b7120413d2770d14d48951b854cb3dc454a5729ef573190c79b9fe15b222","observation_id":"a9e2aed3-f7cb-4920-b02b-d9226a645ef8","resolution":{"observed_at":"2026-08-09T14:19:51.837280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.172628Z","title":"Improved algorithms for linear stochastic bandits","venue":null,"work_id":"a68b4796-e032-4e52-99af-89ef337a2ced","year":2011},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.842071Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:824d05043c905d81ccbeb9b4c1ff7d42ae294e200f0f48fd32ffab0d10d66650","observation_id":"eeb90841-1345-4e41-b206-70885f44a7a9","resolution":{"observed_at":"2026-08-09T14:19:52.176914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.162220Z","title":"Near-optimal discrete optimization for experimental design: A regret minimization approach","venue":null,"work_id":"889f042d-cc41-4d03-b519-b9723f0b157d","year":2021},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.845372Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:3ee5f141fa2d33d686a1e7b737ba8ea57d60c71213b33a8f71e3bed154516562","observation_id":"48bb65b3-5523-46c3-8f38-e793d7315b3d","resolution":{"observed_at":"2026-08-09T14:19:52.166256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.150910Z","title":null,"venue":null,"work_id":"3308a3de-e1fd-4f09-82af-543501d98ed2","year":2002},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.848793Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:44cc8abc471d65d051c1048d084f96fe23d1829edb9ea841f1700e37c19cbb79","observation_id":"797df648-711a-4078-b2ba-0d730ef58bd0","resolution":{"observed_at":"2026-08-09T14:19:52.155293Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.138517Z","title":"G., Osband, I., and Munos, R","venue":null,"work_id":"e6e8b449-fa6a-41f4-b279-17ddeaeb9b8f","year":2017},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.852301Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:5f55d15cb2725738598c9c32f55b04cad5f5fcda58b246df9e21a3a37ae51f3f","observation_id":"047d5f60-4c25-45bc-98ea-aad9dcd95919","resolution":{"observed_at":"2026-08-09T14:19:52.142619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.126954Z","title":"and Sundberg, C.-E","venue":null,"work_id":"1b138055-b143-44dc-aaaf-a5d0200676cb","year":1979},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.855536Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:b4d3a2fdd592c2966380164b5db05d69520bad5a8a744d7c028132899f587891","observation_id":"f64a0e19-359e-4ce6-949e-26d36f838ad3","resolution":{"observed_at":"2026-08-09T14:19:52.131058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.114689Z","title":"On the theory of reinforcement learning with once-per-episode feedback","venue":null,"work_id":"0d6e9e9c-7f1c-49c2-b2ed-199f791f242e","year":2021},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.859125Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:6da397ffc9589dd28ab68a9e4e3b40f4381d92f9b2c297d90949f94560d3f4b1","observation_id":"9708ab51-edfd-4bf4-b011-f37a9bdfb6ae","resolution":{"observed_at":"2026-08-09T14:19:52.119563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.103455Z","title":"Unifying pac and regret: Uniform pac bounds for episodic reinforcement learning","venue":null,"work_id":"a321201c-e2c4-457b-9098-4593337d5e38","year":2017},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.862300Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:89bbf4dbd446dd035ac977d4a7da8afef40cce34e1263557bad18d0220be6c70","observation_id":"4254ac76-f449-49fa-b2f2-080697f08db9","resolution":{"observed_at":"2026-08-09T14:19:52.107444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.092900Z","title":"Reinforcement learning with trajectory feedback","venue":null,"work_id":"36ffa4ae-9b42-4aef-a361-03793e4d63f1","year":2021},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.864992Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:75e211d9b4e7ef3a56b1750a67f0c09e5e0d6ea9a750b5cb7dd5603a8f71e08e","observation_id":"e906830f-dac6-4f56-9ed3-365145e617dd","resolution":{"observed_at":"2026-08-09T14:19:52.096493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.868220Z","title":"Improved optimistic algorithms for logistic bandits","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.868220Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:719d082f47e379c6b9b06ff4fed33c990f5f190b7a059e24f5d15da97c8cd4a9","observation_id":"fb8f7803-616b-4706-98c9-9f1248569426","resolution":{"observed_at":"2026-08-09T14:19:51.868220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.077375Z","title":"Parametric bandits: The generalized linear case","venue":null,"work_id":"55f9d9c5-3e55-434b-b4e0-0d35b08bac64","year":2010},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.871243Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:29664e7c825eb6019389ae9287d85f523ddde36f6f1f182e21f5169086897980","observation_id":"d7d7eccb-65ee-42ee-bcd1-d734a6f62da8","resolution":{"observed_at":"2026-08-09T14:19:52.080447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.067037Z","title":"Harnessing causality in reinforcement learning with bagged decision times","venue":null,"work_id":"65bb29a4-0cb8-4a45-b48e-ce96d67c8c6b","year":2025},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.874352Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:94fa0525311dbd170675bbdc985ac500ac96581107f71e2062477339c2585202","observation_id":"a9985149-adc6-43e9-91ed-5dadc67c580c","resolution":{"observed_at":"2026-08-09T14:19:52.070439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.055068Z","title":null,"venue":null,"work_id":"e29c22a9-1805-4211-84c8-96bdbdc75a1e","year":2013},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.877211Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:3af4434591e79742e820a3f1bd2a1155e759b36df42bdeea270f5755b32ff576","observation_id":"c2cb0f95-f8d3-4aef-9dcf-5b58cf0598e5","resolution":{"observed_at":"2026-08-09T14:19:52.058986Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.044735Z","title":"Near-optimal regret bounds for reinforcement learning","venue":null,"work_id":"f99967a5-d029-4fb6-8862-fe02f1cb512d","year":2010},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.879915Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:948d2e0650056fe7ed9b48df31edb546349df0200a7bfd20f3a798acd74ee3d1","observation_id":"d422c481-9aa1-411d-8d41-79dc6dd9e9cd","resolution":{"observed_at":"2026-08-09T14:19:52.048612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.035315Z","title":null,"venue":null,"work_id":"b05da6ba-710a-4e9d-aa28-b89c0925bb1e","year":2018},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.882770Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:3e2e17bbea244b310908ae6f0c825bf17b1857942de24a2852e0d7c4ff3fd431","observation_id":"5b0bfe69-5799-4b8a-8fd0-7f183172296f","resolution":{"observed_at":"2026-08-09T14:19:52.038642Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.025679Z","title":"and Hutter, M","venue":null,"work_id":"b48354f5-d4c9-4671-b48f-2963e5396491","year":2012},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.886343Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:276e2187679e8e3c37589561f090776aa3111cbb21469a50f8b3d325d2f0392e","observation_id":"b5dad29f-7bf6-47e8-92c7-26568c55f415","resolution":{"observed_at":"2026-08-09T14:19:52.028471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.015699Z","title":"and Massart, P","venue":null,"work_id":"1e58495a-76db-40ff-9bc7-31ff582a0ee1","year":2000},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.889347Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:46f23d708ac9812250b8d38ae9281437aa538522040d3225b63015d1673fccad","observation_id":"9be24f8c-4c6a-45fe-b684-70e86e12cc16","resolution":{"observed_at":"2026-08-09T14:19:52.019473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.892457Z","title":"D., Jonsson, A., Kaufmann, E., Leurent, E., and Valko, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.892457Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:33d20da9b415d281fea99a63cd6d45ae6ed6a54beaa351f7a1d1960c47ff4c02","observation_id":"22347b28-8b4a-44a4-84d6-ac0ff433e6ce","resolution":{"observed_at":"2026-08-09T14:19:51.892457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:52.000580Z","title":"and Moore, A","venue":null,"work_id":"bdb3d190-35f9-4fa6-8646-5d19bb86d37d","year":1999},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.895685Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:29022bec20cabc51c60581a81741395129b59af4a01dd2b1aeed645fb55192e3","observation_id":"efd83852-8ee7-485f-a728-2325face270d","resolution":{"observed_at":"2026-08-09T14:19:52.003308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.991848Z","title":"Optimal design of experiments","venue":null,"work_id":"8a47b517-272e-46fc-bdd5-9574d3bed53c","year":2006},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.898605Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:2e770adcaaef1e37ac7018acc7ef79bb50d40a64ccd67a151b4a5b1e43615fed","observation_id":"05dfcaf2-1f5b-4aa8-8b19-d3ae9b83aabb","resolution":{"observed_at":"2026-08-09T14:19:51.995256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.982737Z","title":"Self-concordant analysis of generalized linear bandits with forgetting","venue":null,"work_id":"b1208317-6072-4684-a49c-9c1d991784df","year":2021},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.901392Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:3be42f4d72735c927cf1bccfa689d7566c5fb137cb2c067a568945d5dc7fb74d","observation_id":"f4451481-f3ee-475b-82b5-6f603bcb7e04","resolution":{"observed_at":"2026-08-09T14:19:51.986161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.904455Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.904455Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:7fd2625be7075fe034d1208b276ff38f492fdc288497946baabadcda06dba67a","observation_id":"19dcb54f-00ab-46af-96f0-463ae0cb0835","resolution":{"observed_at":"2026-08-09T14:19:51.904455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.966452Z","title":"Reinforcement learning from bagged reward","venue":null,"work_id":"80af8c21-5d17-4a28-9c37-89118bdcc749","year":2024},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.908053Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:98d0b4deffa80ed0f256da88ee8eff443ba5626e656d826d1a9a42c873333210","observation_id":"ed638af5-d215-4e19-996b-97ec7b8aa83e","resolution":{"observed_at":"2026-08-09T14:19:51.970970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.911511Z","title":null,"venue":null,"work_id":null,"year":1933},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.911511Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:7657a11623c236277cf3ab340051b9b085dd2112cb1717a2618ce023502a81d3","observation_id":"84586d59-6cec-4806-a0e8-c061cd2a6dd2","resolution":{"observed_at":"2026-08-09T14:19:51.911511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.951163Z","title":null,"venue":null,"work_id":"90fd268a-7db6-4cd2-a00b-2b61abb18fdc","year":2015},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.914853Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:5362dec5dadf6c9fd09c3edd13a402299bf676178acd3c1f24ab96df1d41d20f","observation_id":"4cad5ac9-f212-46e7-903c-f6f62a6953da","resolution":{"observed_at":"2026-08-09T14:19:51.954438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:19:51.939725Z","title":"and Brunskill, E","venue":null,"work_id":"abb70663-4a03-4c0c-ac7d-2308fbf44816","year":2019},"citing_paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T14:19:51.917733Z"},"links":{"citing_paper":"/paper/2502.01876"},"observation_digest":"sha256:34ef1f5775a4611cb70acfe0e7215611cd3cbfb63d6d33cae60910060c63ae6d","observation_id":"3bc721f4-5633-47d3-8fc7-93a12b879514","resolution":{"observed_at":"2026-08-09T14:19:51.944380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.01876","last_updated":"2025-06-17T17:54:41Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T22:25:12.546901Z","submitted_at":"2025-02-03T23:08:42Z","title":"Reinforcement Learning with Segment Feedback"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 2 inbound Pith citation observations for arXiv:2502.01876."}