{"as_of":"2026-08-10T02:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd0fb343405d1549665f631b1f2a296d435d88373a472bef32e90cf21b947691","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T20:45:51.330020Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:21:39.763211Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T13:01:03.227843Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19300","snapshot_observed_at":"2026-08-07T13:21:39.763211Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22254","last_updated":"2025-05-28T11:41:07Z","snapshot_observed_at":"2026-08-07T13:09:25.807515Z","submitted_at":"2025-05-28T11:41:07Z","title":"A Unified Online-Offline Framework for Co-Branding Campaign Recommendations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:21:39.763211Z"},"links":{"cited_paper":"/paper/2501.19300","citing_paper":"/paper/2505.22254"},"observation_digest":"sha256:03026d52bba5791ed1c2799958e8ca6843a0976c52061bcd336e622a0e22b31c","observation_id":"f8ea145b-77bb-4e00-b5a3-9d4a7136a459","resolution":{"observed_at":"2026-08-07T13:21:39.763211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19300","snapshot_observed_at":"2026-08-07T13:07:12.820368Z","title":"Ofﬂine learning for combinatorial multi-armed bandits","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23165","last_updated":"2025-05-29T06:58:49Z","snapshot_observed_at":"2026-08-09T13:40:11.410845Z","submitted_at":"2025-05-29T06:58:49Z","title":"Best Arm Identification with Possibly Biased Offline Data","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T13:07:12.820368Z"},"links":{"cited_paper":"/paper/2501.19300","citing_paper":"/paper/2505.23165"},"observation_digest":"sha256:2d32f7d49c15a7ecd53326d974007157240a55367f3846e66a3e3eeb127b1495","observation_id":"10d820ea-91f9-4035-99eb-0e8e69edb66d","resolution":{"observed_at":"2026-08-07T13:07:12.820368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"cited_work":{"arxiv_id":"2501.19300","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.19300","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9c8c7ac9-0a10-4447-99dc-1c82af94fc91","year":2025},"citing_paper":{"arxiv_id":"2604.20021","last_updated":"2026-04-21T21:56:43Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-21T21:56:43Z","title":"Continuous Semantic Caching for Low-Cost LLM Serving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T02:32:28.923367Z"},"links":{"cited_paper":"/paper/2501.19300","citing_paper":"/paper/2604.20021"},"observation_digest":"sha256:02eb77e91066c2db60e4e0cbe54354cf0215e11c9f3d93a7c514ab5340cfb174","observation_id":"48485c5d-b1a8-4be1-8234-88aa0f2e3e94","resolution":{"observed_at":"2026-05-11T13:01:03.233839Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.19300/citation-record","integrity":"/paper/2501.19300/integrity","json":"/paper/2501.19300/citation-record.json","paper":"/paper/2501.19300"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-03T19:11:09.671782Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-09T20:45:51.240862Z","title":"Casper, S., Davies, X., Shi, C., Gilbert, T","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.240862Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:0ab3bb56475f38a6634ebf866768e6a500afbafa204394f066e5cf8f986886d0","observation_id":"db8e2882-4d5e-4719-b39d-617a0ab8bac5","resolution":{"observed_at":"2026-08-09T20:45:51.240862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:45:51.598564Z","title":"org/CorpusID:260316010","venue":null,"work_id":"7031786e-7d61-4a2c-9277-b62bb5d0824f","year":2012},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.245135Z"},"links":{"citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:737024cafb23ed3cb897d183ee694d965cec5d9b3dab61e09bc9c67c16e7303d","observation_id":"8c305033-b342-454c-bdb5-b6c45b5a5c44","resolution":{"observed_at":"2026-08-09T20:45:51.601471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16587","last_updated":"2024-10-02T13:22:27Z","snapshot_observed_at":"2026-07-06T18:20:09.790181Z","submitted_at":"2024-05-26T14:38:24Z","title":"Cost-Effective Online Multi-LLM Selection with Versatile Reward Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16587","snapshot_observed_at":"2026-08-09T20:45:51.260321Z","title":"org/CorpusID:261065303","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.260321Z"},"links":{"cited_paper":"/paper/2405.16587","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:c1251272dfe134eb01d169a3a32cfbde8696e71252a3aa4b6454bfe8393a94c6","observation_id":"7855778e-9c56-48fe-9df0-62f6d90cb6b0","resolution":{"observed_at":"2026-08-09T20:45:51.260321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:45:51.564361Z","title":"org/CorpusID:235422620","venue":null,"work_id":"e6532baa-d6eb-4816-be11-cb35f0874d3a","year":null},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.266752Z"},"links":{"citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:2f2bcdcea00b68ea0298566d229a51ea2b2bea66bf5fce62c7bd33b2481184e9","observation_id":"bbc163c9-358f-448a-b0be-ad6eb602ac49","resolution":{"observed_at":"2026-08-09T20:45:51.567700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-09T20:45:51.272633Z","title":"org/CorpusID:265067391","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.272633Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:f75708ee57f983e90af7857bc48104268947ffb9b772063324ed0bff33d64a67","observation_id":"54697854-2ab7-445d-aded-fe9230791a52","resolution":{"observed_at":"2026-08-09T20:45:51.272633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:45:51.555068Z","title":"org/CorpusID:28202810","venue":null,"work_id":"fa09214e-8295-44b5-9c2d-ac12c2efe3a5","year":null},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.275614Z"},"links":{"citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:b9f32c4d8cce20c95d9669e5182f6f7e21c07e2563bc6cf94383156060987d31","observation_id":"8af85bdc-b3b7-4c20-8188-b68f71918e83","resolution":{"observed_at":"2026-08-09T20:45:51.558097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:45:51.538175Z","title":"org/CorpusID:211011033","venue":null,"work_id":"aff88cf8-2ad2-403d-988c-c22576bf8495","year":null},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.284421Z"},"links":{"citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:a3022fa11e0646cfbf7def71c8d12a776e27425e67751ecbe581bf28a58da00e","observation_id":"95527f5c-b25a-417f-bc83-1c8bf0faed81","resolution":{"observed_at":"2026-08-09T20:45:51.541147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04779","last_updated":"2020-08-19T17:07:05Z","snapshot_observed_at":"2026-08-08T08:26:41.512776Z","submitted_at":"2020-06-08T17:53:42Z","title":"Conservative Q-Learning for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04779","snapshot_observed_at":"2026-08-09T20:45:51.287327Z","title":"org/CorpusID:173990380","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.287327Z"},"links":{"cited_paper":"/paper/2006.04779","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:b47a64d988a968ca44a470622ae5d6c93d7997632a43c4e5061860054b1b7421","observation_id":"76af462e-7a05-49b3-8faf-063dfdb8550f","resolution":{"observed_at":"2026-08-09T20:45:51.287327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-09T20:45:51.290290Z","title":"org/CorpusID:261697361","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.290290Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:33dda9665e158dad7cde33ddfa015bff52d71e254934447e3376dd899a022184","observation_id":"93148686-93fe-4156-b119-74e4ab0041cd","resolution":{"observed_at":"2026-08-09T20:45:51.290290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17075","last_updated":"2025-05-14T02:28:36Z","snapshot_observed_at":"2026-08-02T18:25:46.212434Z","submitted_at":"2024-10-22T14:52:46Z","title":"Combinatorial Logistic Bandits","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17075","snapshot_observed_at":"2026-08-09T20:45:51.293340Z","title":"org/CorpusID:219676905","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.293340Z"},"links":{"cited_paper":"/paper/2410.17075","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:6540d898f2122499f90347f7c78f28026080b9adfc335854ea417cb44c03b4ba","observation_id":"9e3ea8a1-7526-4dba-bd8e-139450246a45","resolution":{"observed_at":"2026-08-09T20:45:51.293340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:45:51.529155Z","title":"org/CorpusID:208617840","venue":null,"work_id":"2ccd08f7-7907-4c54-9938-68f23f1a3a71","year":2015},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.296440Z"},"links":{"citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:5d4438e10d8f82112848a39d619a7d71644fee926f70166fe6fa30b341537860","observation_id":"38fdfbfd-c5d2-4fed-873a-175b79d59611","resolution":{"observed_at":"2026-08-09T20:45:51.532232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00716","last_updated":"2022-11-01T19:28:48Z","snapshot_observed_at":"2026-08-09T22:26:30.027097Z","submitted_at":"2022-11-01T19:28:48Z","title":"Optimal Conservative Offline RL with General Function Approximation via Augmented Lagrangian","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00716","snapshot_observed_at":"2026-08-09T20:45:51.304986Z","title":"org/CorpusID:271534421","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.304986Z"},"links":{"cited_paper":"/paper/2211.00716","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:cea3baa6da6d0e9f8f4cb68b2c1571ad61f0a152a1e0f548b1408769a7be98c5","observation_id":"6579d043-19b6-49cd-9ec0-21dd3b22a6c8","resolution":{"observed_at":"2026-08-09T20:45:51.304986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.13890","last_updated":"2022-06-10T21:36:10Z","snapshot_observed_at":"2026-08-06T06:31:56.061050Z","submitted_at":"2022-02-28T15:39:36Z","title":"Pessimistic Q-Learning for Offline Reinforcement Learning: Towards Optimal Sample Complexity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.13890","snapshot_observed_at":"2026-08-09T20:45:51.310714Z","title":"org/CorpusID:257495837","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.310714Z"},"links":{"cited_paper":"/paper/2202.13890","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:c9a68a96c32978d2e5dbf2ae931ebab973233fc0c979b236a22d9885fd432f62","observation_id":"08f0f9f1-6674-45f7-809c-eb401a3af3e2","resolution":{"observed_at":"2026-08-09T20:45:51.310714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:45:51.511737Z","title":"org/CorpusID:247159013","venue":null,"work_id":"d1a002ed-81a4-4d36-9010-f52c061b0f6a","year":null},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.314366Z"},"links":{"citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:88ad60f2692c3205643fbd0afe7c02f7011dd808b1b0169c2b16bce5473c6a54","observation_id":"be06bb87-33b5-4d46-add2-abc07efeb513","resolution":{"observed_at":"2026-08-09T20:45:51.514846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:45:51.503074Z","title":"org/CorpusID:234826156","venue":null,"work_id":"34985861-63fa-471f-a1b2-d94bb7ef6cf0","year":2025},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.317544Z"},"links":{"citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:025fd111f65823ab55abd7eb857f15b5aeb86fd44a9a645d24ab779c591f8ff8","observation_id":"381b336d-2739-4898-a2c8-78d153bb1614","resolution":{"observed_at":"2026-08-09T20:45:51.506058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16074","last_updated":"2023-05-25T14:02:12Z","snapshot_observed_at":"2026-08-09T04:58:13.858368Z","submitted_at":"2023-05-25T14:02:12Z","title":"Combinatorial Bandits for Maximum Value Reward Function under Max Value-Index Feedback","version":1},"cited_work":{"arxiv_id":"2305.16074","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16074","snapshot_observed_at":"2026-08-09T20:45:51.362248Z","title":"Combinatorial Bandits for Maximum Value Reward Function under Max Value-Index Feedback","venue":"cs.LG","work_id":"c5d2c425-bfd9-4768-951e-9589149ad253","year":2023},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.323290Z"},"links":{"cited_paper":"/paper/2305.16074","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:09a354f42d14a04477069c491e086f50ec5a8c53a7bc42d1174d15a5adfe7ae7","observation_id":"8d61b0e5-c68c-4f4c-839d-c83c32270c7e","resolution":{"observed_at":"2026-08-09T20:45:51.367607Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01748","last_updated":"2021-02-02T20:47:35Z","snapshot_observed_at":"2026-07-06T10:37:57.247378Z","submitted_at":"2021-02-02T20:47:35Z","title":"Near-Optimal Offline Reinforcement Learning via Double Variance Reduction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01748","snapshot_observed_at":"2026-08-09T20:45:51.326444Z","title":"org/CorpusID:182952558","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.326444Z"},"links":{"cited_paper":"/paper/2102.01748","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:30ab01849dfd51e7ee6d3d9dbdac87b713e0302d063dbf4e611679ea37c19434","observation_id":"b3948507-b6c0-493c-84d1-f140e1c85c37","resolution":{"observed_at":"2026-08-09T20:45:51.326444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:45:51.494554Z","title":"batch RL","venue":null,"work_id":"bb60a3a8-6f04-49aa-940c-4eea7b22f962","year":2012},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.330020Z"},"links":{"citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:36ff04e29950ff22f751dead65ee60fb08bd9291870a07bae2f3ceb0ee0edaa8","observation_id":"07807c96-acf2-4d08-a417-a12ef182ceb4","resolution":{"observed_at":"2026-08-09T20:45:51.497389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:45:51.582179Z","title":"Chen, W., Wang, Y ., Yuan, Y ., and Wang, Q","venue":null,"work_id":"9feded51-c723-461f-b1bd-f5082a1f3a5b","year":2013},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":159,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.251749Z"},"links":{"citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:864aca5b8fc5ed6e5a4eefcb9d3dc9215260b5077794106e656d88351401ab8e","observation_id":"344d2a49-3e32-46dc-9660-ddf9eb52c55a","resolution":{"observed_at":"2026-08-09T20:45:51.585326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.13807","last_updated":"2022-03-13T14:15:14Z","snapshot_observed_at":"2026-07-06T12:12:39.412868Z","submitted_at":"2021-11-27T03:57:13Z","title":"Offline Neural Contextual Bandits: Pessimism, Optimization and Generalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.13807","snapshot_observed_at":"2026-08-09T20:45:51.299080Z","title":"Nguyen-Tang, T., Gupta, S., Nguyen, A","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":1375,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.299080Z"},"links":{"cited_paper":"/paper/2111.13807","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:f4f224d962d1c12d312851c3a0f3751c04e80cbbd55aa228dbe260afa0a5fb67","observation_id":"f0d021d4-ce4c-4168-b817-aae430c59d10","resolution":{"observed_at":"2026-08-09T20:45:51.299080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.12179","last_updated":"2020-11-02T07:11:07Z","snapshot_observed_at":"2026-08-01T14:44:08.471023Z","submitted_at":"2019-10-27T04:43:19Z","title":"BAIL: Best-Action Imitation Learning for Batch Deep Reinforcement Learning","version":4},"cited_work":{"arxiv_id":"1910.12179","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.12179","snapshot_observed_at":"2026-08-09T20:45:51.470516Z","title":"BAIL: Best-Action Imitation Learning for Batch Deep Reinforcement Learning","venue":"cs.LG","work_id":"92e6774d-ba20-4e45-a80c-c60292c5d26f","year":2019},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":1716,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.257220Z"},"links":{"cited_paper":"/paper/1910.12179","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:2f1295270dd3120d87b8e7c0b6bb8e76c90d596e52aa2083867bc4bb2fe199c2","observation_id":"81094f23-1291-4af3-b765-6014b6bf125e","resolution":{"observed_at":"2026-08-09T20:45:51.473838Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:45:51.573162Z","title":"Chen, W., Sun, X., Zhang, J., and Zhang, Z","venue":null,"work_id":"07d6bcbe-7cea-41c0-9090-4f0e915e43dc","year":2020},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":1724,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.254515Z"},"links":{"citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:db00d442a1bf8b9201069cac83cf5708302552efcbf67f5c5f57e637f431b692","observation_id":"3221d8a7-3f70-4945-8590-ff8aab70b250","resolution":{"observed_at":"2026-08-09T20:45:51.576296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:45:51.520440Z","title":"org/CorpusID:5785954","venue":null,"work_id":"5762c174-e348-454d-ae6a-15b3385bc032","year":2005},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.308050Z"},"links":{"citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:4d7541126ad887675876611ae2df0b4d8a2ade99b1035250134260455e5ed791","observation_id":"b12ba690-c6da-4fe8-baba-40e184e47fbf","resolution":{"observed_at":"2026-08-09T20:45:51.523454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.00024","last_updated":"2016-04-27T18:27:20Z","snapshot_observed_at":"2026-08-04T23:46:48.692131Z","submitted_at":"2015-02-27T21:59:08Z","title":"Influence Maximization with Bandits","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.00024","snapshot_observed_at":"2026-08-09T20:45:51.320267Z","title":"org/CorpusID:8617488","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.320267Z"},"links":{"cited_paper":"/paper/1503.00024","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:3d9cd6a26a6e081a60fd9b515d69cc3cab22f478599bec7831fc2c7d0ef8b3be","observation_id":"b6597414-f24d-4d37-9692-0501639f9d68","resolution":{"observed_at":"2026-08-09T20:45:51.320267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:45:51.614724Z","title":"org/CorpusID:742580","venue":null,"work_id":"5f92e42c-8fa8-4593-b40d-028a5fae1c86","year":2016},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.234422Z"},"links":{"citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:f3690ce0cdc9248f3f60d3bac0922ba8f7b9db1039bdf7f0da0f936199f2dd05","observation_id":"7cf04bf9-123b-47c6-8845-55e8bf2f7038","resolution":{"observed_at":"2026-08-09T20:45:51.617647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04934","last_updated":"2024-04-25T15:45:19Z","snapshot_observed_at":"2026-07-06T16:44:55.494764Z","submitted_at":"2023-11-07T18:17:05Z","title":"Prompt Cache: Modular Attention Reuse for Low-Latency Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04934","snapshot_observed_at":"2026-08-09T20:45:51.269548Z","title":"org/CorpusID:54457299","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.269548Z"},"links":{"cited_paper":"/paper/2311.04934","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:df3724648f07cf952f3769e7a78215b2752242b93b0e4bc6ff4691a91b99fa89","observation_id":"f5c29039-d30e-42c7-8632-b2361c11eb78","resolution":{"observed_at":"2026-08-09T20:45:51.269548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.11566","last_updated":"2022-02-23T15:27:16Z","snapshot_observed_at":"2026-08-09T10:57:51.283770Z","submitted_at":"2022-02-23T15:27:16Z","title":"Pessimistic Bootstrapping for Uncertainty-Driven Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.11566","snapshot_observed_at":"2026-08-09T20:45:51.230499Z","title":"org/CorpusID:212628904","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.230499Z"},"links":{"cited_paper":"/paper/2202.11566","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:8cec18f4c6b31a1505973af0f2423773a4b88caaddb8bb8d2c0cf21e78841902","observation_id":"426821e6-a2a3-4417-8b55-ab3aa0cc3396","resolution":{"observed_at":"2026-08-09T20:45:51.230499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:45:51.546782Z","title":"org/CorpusID:218595964","venue":null,"work_id":"870914d0-d9d6-4e6c-8bbd-844bd77c8d83","year":null},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.281614Z"},"links":{"citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:0c21f11d0e3ed650f074526bc06fd141cc07dc9d3ea321a1a76818ece773641e","observation_id":"d9085009-17ac-49fd-86da-a6e5a528f45b","resolution":{"observed_at":"2026-08-09T20:45:51.549708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:45:51.590520Z","title":"org/CorpusID:248498378","venue":null,"work_id":"9411bdf5-f15c-4eb7-bb3e-8f23d53ed827","year":2018},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.248442Z"},"links":{"citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:3cfc400e4b12bf96ae75750289add025ceb0a7687627010ffa98f2bd8b871351","observation_id":"8b0f495f-916a-4b32-998d-8541f084a556","resolution":{"observed_at":"2026-08-09T20:45:51.593412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18921","last_updated":"2025-03-20T05:23:42Z","snapshot_observed_at":"2026-07-06T18:52:34.247456Z","submitted_at":"2024-07-09T13:47:05Z","title":"Mobile Edge Intelligence for Large Language Models: A Contemporary Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18921","snapshot_observed_at":"2026-08-09T20:45:51.302066Z","title":"org/CorpusID:253420623","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.302066Z"},"links":{"cited_paper":"/paper/2407.18921","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:7ed67295b19b304d4cc5fff833ffb04292441e67ec18aa5627a597cb3a53e17a","observation_id":"7530a131-89a5-4de1-b794-08641b2ac8f1","resolution":{"observed_at":"2026-08-09T20:45:51.302066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T20:45:51.606661Z","title":"org/CorpusID:265607979","venue":null,"work_id":"7fd29a2e-baf4-450d-9e0e-d8584140e134","year":2020},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.237555Z"},"links":{"citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:14432d9b276cc3d46f24aa063fd5af8deedaaff46d65f13fe618a5e983070cfa","observation_id":"1cf2222b-b99e-4bf3-aea8-01f2958ce89c","resolution":{"observed_at":"2026-08-09T20:45:51.609509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05950","last_updated":"2024-05-09T17:40:09Z","snapshot_observed_at":"2026-07-30T22:29:41.342987Z","submitted_at":"2024-05-09T17:40:09Z","title":"Federated Combinatorial Multi-Agent Multi-Armed Bandits","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05950","snapshot_observed_at":"2026-08-09T20:45:51.263570Z","title":"org/CorpusID:273185502","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.263570Z"},"links":{"cited_paper":"/paper/2405.05950","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:1e7143d720f094a1453fee8fe3e64bad861a982fff069d028396dfdfd3841600","observation_id":"9a44dbf7-bfa7-473d-8879-edddb7f42f7b","resolution":{"observed_at":"2026-08-09T20:45:51.263570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.13341","last_updated":"2020-06-01T03:28:44Z","snapshot_observed_at":"2026-07-06T07:56:54.143277Z","submitted_at":"2019-05-30T22:39:57Z","title":"On Value Functions and the Agent-Environment Boundary","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.13341","snapshot_observed_at":"2026-08-09T20:45:51.278487Z","title":"Hwang, T., Chai, K., and Oh, M.-h","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits","version":2},"reference_index":4039,"source":"pdf_text","source_observed_at":"2026-08-09T20:45:51.278487Z"},"links":{"cited_paper":"/paper/1905.13341","citing_paper":"/paper/2501.19300"},"observation_digest":"sha256:0155f325ba4041466b7d6aa9956ce31d4aa6570906acaa9c234ba2b8f5a3fa1a","observation_id":"84f67030-58b8-4fe6-92ad-096876af497c","resolution":{"observed_at":"2026-08-09T20:45:51.278487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.19300","last_updated":"2025-05-29T03:11:10Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T22:27:23.690951Z","submitted_at":"2025-01-31T16:56:18Z","title":"Offline Learning for Combinatorial Multi-armed Bandits"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 3 inbound Pith citation observations for arXiv:2501.19300."}