{"as_of":"2026-08-10T22:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:133b4bbd41d7d779f409068693029cdfe30e936554d830855fa006e70d1a7101","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T17:49:58.484710Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.01081/citation-record","integrity":"/paper/2606.01081/integrity","json":"/paper/2606.01081/citation-record.json","paper":"/paper/2606.01081"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:49:58.484710Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.01081","last_updated":"2026-05-31T07:58:28Z","snapshot_observed_at":"2026-08-05T20:52:24.032043Z","submitted_at":"2026-05-31T07:58:28Z","title":"Decision-Focused On-Policy Learning for Contextual Linear Optimization with Partial Feedback","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T17:49:58.484710Z"},"links":{"citing_paper":"/paper/2606.01081"},"observation_digest":"sha256:33d33adc5d0e336695d42b7e2745489796a5592d2184883d5d7d315aec33d4e1","observation_id":"23d07746-e462-4689-94c4-33a6fe27e6a9","resolution":{"observed_at":"2026-06-28T17:49:58.484710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2405.16564","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:52:27.361038Z","title":"predict, then optimize","venue":null,"work_id":"9a5035e6-df67-4c70-b99d-194ec1926206","year":2008},"citing_paper":{"arxiv_id":"2606.01081","last_updated":"2026-05-31T07:58:28Z","snapshot_observed_at":"2026-08-05T20:52:24.032043Z","submitted_at":"2026-05-31T07:58:28Z","title":"Decision-Focused On-Policy Learning for Contextual Linear Optimization with Partial Feedback","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T17:49:58.484710Z"},"links":{"citing_paper":"/paper/2606.01081"},"observation_digest":"sha256:28b20b553f1a5a8cdfda0f5afce39179b4ff2a1f6b6c2fe694c6146e941c15ed","observation_id":"7dbad068-a05e-4407-827d-57adf908cc41","resolution":{"observed_at":"2026-06-28T17:52:27.362704Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:49:58.484710Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.01081","last_updated":"2026-05-31T07:58:28Z","snapshot_observed_at":"2026-08-05T20:52:24.032043Z","submitted_at":"2026-05-31T07:58:28Z","title":"Decision-Focused On-Policy Learning for Contextual Linear Optimization with Partial Feedback","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T17:49:58.484710Z"},"links":{"citing_paper":"/paper/2606.01081"},"observation_digest":"sha256:77d0cb8c0593be980251e4213263f93663f664dee4d7d8235d6a91a5effcb32c","observation_id":"5f93699a-b264-4f2d-9468-2f3a5e4e89eb","resolution":{"observed_at":"2026-06-28T17:49:58.484710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:49:58.484710Z","title":"Applying the triangle inequality,∥w ⋆(ˆc)∥ ≤BS, and (12) yields ∥∇θw⋆ θ(x)− ∇ θw⋆ θ′(x)∥ ≤B S Z ∥∇θpθ(ˆc|x)− ∇ θpθ′(ˆc|x)∥dˆc≤B S M∇ ∥θ−θ ′∥","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.01081","last_updated":"2026-05-31T07:58:28Z","snapshot_observed_at":"2026-08-05T20:52:24.032043Z","submitted_at":"2026-05-31T07:58:28Z","title":"Decision-Focused On-Policy Learning for Contextual Linear Optimization with Partial Feedback","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T17:49:58.484710Z"},"links":{"citing_paper":"/paper/2606.01081"},"observation_digest":"sha256:bb8e20ae1e6dd51004aea399e539f7b5363a270378c8646d929006f147121c10","observation_id":"0f9ea7ff-0009-4df9-8a73-86cba540bcb0","resolution":{"observed_at":"2026-06-28T17:49:58.484710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:49:58.484710Z","title":"At the beginning of period t, the context is drawn as xt ∼ N(0, I p), with default p= 25","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01081","last_updated":"2026-05-31T07:58:28Z","snapshot_observed_at":"2026-08-05T20:52:24.032043Z","submitted_at":"2026-05-31T07:58:28Z","title":"Decision-Focused On-Policy Learning for Contextual Linear Optimization with Partial Feedback","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T17:49:58.484710Z"},"links":{"citing_paper":"/paper/2606.01081"},"observation_digest":"sha256:e53d4d90d7daf71e7e070d22785102f3feefd1c4eca9f1a42b27b4cc4a648f88","observation_id":"7523f714-ed8a-4da0-a637-4dbe55a06f1c","resolution":{"observed_at":"2026-06-28T17:49:58.484710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:49:58.484710Z","title":"Algorithm 2:Greedy contextual bandit (GREEDYCB) Input:Initial parametersθ 1 ∈R dθ; stepsizeη t >0 fort= 1,2,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01081","last_updated":"2026-05-31T07:58:28Z","snapshot_observed_at":"2026-08-05T20:52:24.032043Z","submitted_at":"2026-05-31T07:58:28Z","title":"Decision-Focused On-Policy Learning for Contextual Linear Optimization with Partial Feedback","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T17:49:58.484710Z"},"links":{"citing_paper":"/paper/2606.01081"},"observation_digest":"sha256:7aaeb30222abd84953e554b43c268b45fa3b1bf6b96ef73123cd38ccfa148967","observation_id":"ea3b30ac-1ccf-4324-a9eb-f51c10c8ac23","resolution":{"observed_at":"2026-06-28T17:49:58.484710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:49:58.484710Z","title":"Figure 4 reports the same comparison on the three remaining benchmarks: top-k selection, shortest path, and energy scheduling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01081","last_updated":"2026-05-31T07:58:28Z","snapshot_observed_at":"2026-08-05T20:52:24.032043Z","submitted_at":"2026-05-31T07:58:28Z","title":"Decision-Focused On-Policy Learning for Contextual Linear Optimization with Partial Feedback","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T17:49:58.484710Z"},"links":{"citing_paper":"/paper/2606.01081"},"observation_digest":"sha256:a738a740e0ec732820c6c1527494d8cbe974e2621dcd32ce4d2164805313d8a4","observation_id":"f57c3e71-037d-4593-9295-5723987dcddb","resolution":{"observed_at":"2026-06-28T17:49:58.484710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:49:58.484710Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01081","last_updated":"2026-05-31T07:58:28Z","snapshot_observed_at":"2026-08-05T20:52:24.032043Z","submitted_at":"2026-05-31T07:58:28Z","title":"Decision-Focused On-Policy Learning for Contextual Linear Optimization with Partial Feedback","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T17:49:58.484710Z"},"links":{"citing_paper":"/paper/2606.01081"},"observation_digest":"sha256:5400c440722512d75fa7219049160cf16348313a71b4746cacde86979324133f","observation_id":"0c66c33e-a458-4317-bd7c-a8a604fc3a0c","resolution":{"observed_at":"2026-06-28T17:49:58.484710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:49:58.484710Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.01081","last_updated":"2026-05-31T07:58:28Z","snapshot_observed_at":"2026-08-05T20:52:24.032043Z","submitted_at":"2026-05-31T07:58:28Z","title":"Decision-Focused On-Policy Learning for Contextual Linear Optimization with Partial Feedback","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T17:49:58.484710Z"},"links":{"citing_paper":"/paper/2606.01081"},"observation_digest":"sha256:a0a1e0123f5e298d5180f8f6620aadea0d63490c57a334d5ef590e68c899381b","observation_id":"a38bccb6-9b4d-4f17-87ec-6ae1500a5354","resolution":{"observed_at":"2026-06-28T17:49:58.484710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:49:58.484710Z","title":"The negative signs on the softmax arguments convert cost minimization to score maximization for the listwise ranking step","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.01081","last_updated":"2026-05-31T07:58:28Z","snapshot_observed_at":"2026-08-05T20:52:24.032043Z","submitted_at":"2026-05-31T07:58:28Z","title":"Decision-Focused On-Policy Learning for Contextual Linear Optimization with Partial Feedback","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T17:49:58.484710Z"},"links":{"citing_paper":"/paper/2606.01081"},"observation_digest":"sha256:a844abe7bd673b6d77e51d71eb6e64c0b802fbfc80da7a90689be55383eaa846","observation_id":"4b5f4a9c-b729-430d-a8af-2ad911bee0b2","resolution":{"observed_at":"2026-06-28T17:49:58.484710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:49:58.484710Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01081","last_updated":"2026-05-31T07:58:28Z","snapshot_observed_at":"2026-08-05T20:52:24.032043Z","submitted_at":"2026-05-31T07:58:28Z","title":"Decision-Focused On-Policy Learning for Contextual Linear Optimization with Partial Feedback","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T17:49:58.484710Z"},"links":{"citing_paper":"/paper/2606.01081"},"observation_digest":"sha256:eff583fee846adff603408e5d7fc744665d6631c8aea97f0b97d8e853fa0ab83","observation_id":"3624af3b-4922-40b4-9270-3bb0004cde83","resolution":{"observed_at":"2026-06-28T17:49:58.484710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:49:58.484710Z","title":"On top- k the gap is more modest at low degrees (around 2× at deg = 2 ) and widens to roughly 4–5× at deg≥4","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.01081","last_updated":"2026-05-31T07:58:28Z","snapshot_observed_at":"2026-08-05T20:52:24.032043Z","submitted_at":"2026-05-31T07:58:28Z","title":"Decision-Focused On-Policy Learning for Contextual Linear Optimization with Partial Feedback","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T17:49:58.484710Z"},"links":{"citing_paper":"/paper/2606.01081"},"observation_digest":"sha256:b619446f4befb6461b36245035ac8d9b5963cdfe6ad362fac912f56e7510cdaf","observation_id":"2ee09b42-e634-4d28-84d8-6a44786fd1b6","resolution":{"observed_at":"2026-06-28T17:49:58.484710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.01081","last_updated":"2026-05-31T07:58:28Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T20:52:24.032043Z","submitted_at":"2026-05-31T07:58:28Z","title":"Decision-Focused On-Policy Learning for Contextual Linear Optimization with Partial Feedback"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2606.01081."}