{"as_of":"2026-08-14T01:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:880c8fd6a2d04101fb5ddda790e834af02a2e800d8262d70afb535ccc4cf32ca","coverage":[{"denominator":98,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:56:30.907292Z","state":"measured"},{"denominator":98,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":98,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23090/citation-record","integrity":"/paper/2506.23090/integrity","json":"/paper/2506.23090/citation-record.json","paper":"/paper/2506.23090"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:22.019910Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:22.019910Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:1a31fa5ec7278ee538ad10d058f6fb7c55827752616c16b0d57f10fe3a9d2329","observation_id":"2e8028d2-ea8d-4f3a-92a5-5180edae4086","resolution":{"observed_at":"2026-08-06T21:56:22.019910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:22.151857Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:22.151857Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:b37cc3c307556281b4e097f850345caa0d8a90e102afbfba9f1187f2b731ad6d","observation_id":"e9226e50-0455-4272-8782-4f7fab678ef0","resolution":{"observed_at":"2026-08-06T21:56:22.151857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:22.224329Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:22.224329Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:af66a6fe82eac0b8bd6f2e222dc11ff96ad58aa09640302507597a63c46620e4","observation_id":"857b7d22-041f-4217-a463-c584a34cce7f","resolution":{"observed_at":"2026-08-06T21:56:22.224329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:22.331041Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:22.331041Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:e35ff1f32e52539d8dc1ee6025f9cd3da8814bfe1147d6a116ae6a7d9e7c1ae3","observation_id":"9adbbf9e-bced-44ab-812b-5b0ebdcb5eee","resolution":{"observed_at":"2026-08-06T21:56:22.331041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:22.442780Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:22.442780Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:b20be38a51f3c8e64a0ce751be205536d5d5da8b3b91886fc3706028142790e2","observation_id":"53da011d-aafa-45cb-9ae3-fdb6cea242bf","resolution":{"observed_at":"2026-08-06T21:56:22.442780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:22.494363Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:22.494363Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:8535b452de8c4929d5560d27d6fe38a9b6acb47cba1cc6c456d90d0327960fc2","observation_id":"54000abe-c3d5-4f06-b8b0-781d623f8443","resolution":{"observed_at":"2026-08-06T21:56:22.494363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:22.577047Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:22.577047Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:1ac6082a2ca82e38cadf5b4ba0dd33f58964ef26b00e4a7d49e9dfc8527137c7","observation_id":"d87591b3-04e0-49e2-b02c-c6abee7e0ce7","resolution":{"observed_at":"2026-08-06T21:56:22.577047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:22.706244Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:22.706244Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:af31b7e6a380318096525a728d79f0125d157c2ba08957d7698d95ef7cbb031f","observation_id":"c3a299c3-62e7-44dd-9a8e-760413c6bf02","resolution":{"observed_at":"2026-08-06T21:56:22.706244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-12T08:59:05.030983Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T21:56:22.767469Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:22.767469Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:a9dc0b4679a90a7ad4ebc1b7165297775ebafb7fd8014152c99ce5ec7de1a288","observation_id":"70b472e2-9568-4ebc-a2ed-18f3a737e1e8","resolution":{"observed_at":"2026-08-06T21:56:22.767469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.01271","last_updated":"2018-04-19T14:32:38Z","snapshot_observed_at":"2026-08-13T10:37:24.864456Z","submitted_at":"2018-03-04T00:20:29Z","title":"An Empirical Evaluation of Generic Convolutional and Recurrent Networks for Sequence Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.01271","snapshot_observed_at":"2026-08-06T21:56:22.872861Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:22.872861Z"},"links":{"cited_paper":"/paper/1803.01271","citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:efc182178c7572756df4ef2bd43a9e9b5644cb282bd59e5377937b2f4e50f2dc","observation_id":"ea5728db-6219-4640-9b79-e7ba6214dc3f","resolution":{"observed_at":"2026-08-06T21:56:22.872861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:22.931605Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:22.931605Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:68f9902704b6e665635ed26c81a52a7477c2f7f91d57b8fb6d9bb9626a365441","observation_id":"1f35ab64-e080-49d4-af23-8559c55e3b3b","resolution":{"observed_at":"2026-08-06T21:56:22.931605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:23.031125Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:23.031125Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:00f4579fa35dc7fbe9f5c4c89010e30b3ee44e9e40ce70fb39a3aae791b4945b","observation_id":"0a5e5798-0fde-49dc-b5cb-f97e133c8062","resolution":{"observed_at":"2026-08-06T21:56:23.031125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:23.170875Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:23.170875Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:e8c1469b3185d72624825f5c463d8b27a774c5d1c0f6ebabdba33f89fec2d57c","observation_id":"22534b54-091b-48ca-a312-d84b32366f7a","resolution":{"observed_at":"2026-08-06T21:56:23.170875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:23.279945Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:23.279945Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:99cb3a290289e5feb287f5684e4677436fec7e31920e75f89cb53937a40ee467","observation_id":"63def480-db9b-49c9-9f72-d0b53ee62529","resolution":{"observed_at":"2026-08-06T21:56:23.279945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:23.393684Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:23.393684Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:7b57864da5da7d3d7c039f074e6f34ab57ea2d97799bd74a084fb8751c74da30","observation_id":"cf3f7f0f-5bdc-461b-a6d3-1cc3f81705f3","resolution":{"observed_at":"2026-08-06T21:56:23.393684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:23.500899Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:23.500899Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:c9621bddd62eb208403366e655f1ab175435b7d7fe484ce7ae99dcfa1198584a","observation_id":"27d06b58-5a65-4bd6-8fed-0ec81869c645","resolution":{"observed_at":"2026-08-06T21:56:23.500899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:23.694368Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:23.694368Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:dd49c30f318963a41cfb5998a67791d37954b81b163a624573f44af05f73cd70","observation_id":"f3504a82-b66a-42f7-a107-aaae77caca7a","resolution":{"observed_at":"2026-08-06T21:56:23.694368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10031","last_updated":"2019-02-11T20:52:42Z","snapshot_observed_at":"2026-08-04T06:42:19.463125Z","submitted_at":"2019-01-28T23:14:58Z","title":"Lyapunov-based Safe Policy Optimization for Continuous Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10031","snapshot_observed_at":"2026-08-06T21:56:23.929345Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:23.929345Z"},"links":{"cited_paper":"/paper/1901.10031","citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:5b577e0c039c0524db60e9c09f056a5b81c8d195ec1731448bfb9f812f0ec278","observation_id":"ef6a3dcf-5bad-4c78-b873-5b64fc606c1b","resolution":{"observed_at":"2026-08-06T21:56:23.929345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:24.061437Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:24.061437Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:7245b65a03df292869bf15a5ad76935d3adca92dd4d71560729b31a1a237eece","observation_id":"7a34ed59-7fae-4af3-9fae-53c5d5b066f0","resolution":{"observed_at":"2026-08-06T21:56:24.061437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:24.189281Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:24.189281Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:8a121b55e8051b281dc25ac2ec9218aa84a4bea1a2bc6f97bb280834007a6aac","observation_id":"b9ef60d7-0954-46f7-a6f0-f7f60a322c52","resolution":{"observed_at":"2026-08-06T21:56:24.189281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:38.804238Z","title":null,"venue":null,"work_id":"731f7b1d-9bdd-4d3a-b53d-ed9eae742224","year":2007},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:24.279364Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:82d5a05d6be4dc5354e75f37b77638ee87445b8046481f9da2a571dea09cbe33","observation_id":"ee0588b4-b5b9-4619-9812-b202a100ab63","resolution":{"observed_at":"2026-08-06T21:56:38.858151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:38.643509Z","title":null,"venue":null,"work_id":"d82bbbac-d118-469c-9d95-382dff6fc65d","year":2016},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:24.381749Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:2d80aba9b492f1c5c0b363142bc92d99b1bd3f67c58e15f431a2ae83755e7dc2","observation_id":"5aa4b159-be77-4453-864d-e581eb8e6cc2","resolution":{"observed_at":"2026-08-06T21:56:38.747132Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:38.537231Z","title":null,"venue":null,"work_id":"a017d0f3-e90e-40a5-8653-e3510969a2c2","year":2019},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:24.495300Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:8c92b2b8bcccfb1e85b32dd867c527bb7c075d9fa468d209a1280aca8bec949b","observation_id":"7d1f2edd-7d35-4e61-a7bc-957b702eee2f","resolution":{"observed_at":"2026-08-06T21:56:38.564719Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:24.618224Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:24.618224Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:dad112ae1627b83f8a3354190e5ffad34191bbce99f093ece49a777c1d4fb1fc","observation_id":"87961558-bb4e-4555-bcd4-2ccc1aed13af","resolution":{"observed_at":"2026-08-06T21:56:24.618224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:24.736783Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:24.736783Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:820558f44f2d7f29be591666dcb90b9c3a3d8408f8842db19b14b3213b42f583","observation_id":"99d67829-b68e-4a9d-b9fc-08580a125ba3","resolution":{"observed_at":"2026-08-06T21:56:24.736783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.07621","last_updated":"2021-12-12T09:34:50Z","snapshot_observed_at":"2026-08-13T17:17:29.174743Z","submitted_at":"2021-12-12T09:34:50Z","title":"Re-ranking With Constraints on Diversified Exposures for Homepage Recommender System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.07621","snapshot_observed_at":"2026-08-06T21:56:24.860994Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:24.860994Z"},"links":{"cited_paper":"/paper/2112.07621","citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:740ee4eb6941b5739f4f92d8cd3371ea5ba96cf64740f7c7ccbd5a8f127cacc4","observation_id":"f157c612-3898-4c27-aaa9-f168de0cab92","resolution":{"observed_at":"2026-08-06T21:56:24.860994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:38.364674Z","title":null,"venue":null,"work_id":"3f8e4162-eacb-4c0d-bd50-ee46cb44e5e6","year":2020},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:24.957875Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:f16b0b865abcbc6d6be5f0cb2b008952da1d44bbb8102ed0a84e3bac83761aa2","observation_id":"1d8f3ac7-9d12-4aee-8922-01b90c01010a","resolution":{"observed_at":"2026-08-06T21:56:38.430798Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:25.092752Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:25.092752Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:4bca94c0a682d5988f3a804ab021028b39232b874547171c40a529b74e8241fa","observation_id":"8ed87b86-a04f-445a-a38e-90af39180915","resolution":{"observed_at":"2026-08-06T21:56:25.092752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:25.211453Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:25.211453Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:bff86f14024f5dce09bdfd4e13a08fc83fde83d86a690499fa81102ed9108804","observation_id":"8b650e81-8ba2-4b8b-9d2d-06a0b2344259","resolution":{"observed_at":"2026-08-06T21:56:25.211453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:38.274738Z","title":null,"venue":null,"work_id":"762f4a82-f5b8-466f-af50-00b4c6bfe731","year":2018},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:25.292522Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:4ca273323c51a30f852d0bfe85c3ed833082d0668d4d7b3afc6aeeecc444a85d","observation_id":"cf1e05a1-f3a0-426c-922b-b3be89c868cf","resolution":{"observed_at":"2026-08-06T21:56:38.310810Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:38.106747Z","title":null,"venue":null,"work_id":"05a91b07-db1d-49f7-ae02-eabcfd1664a4","year":2016},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:25.395021Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:01e05e11f56302c7a13d51ab3543cc3d4cd666787b4bedaf3bc96236197d387b","observation_id":"e068fc3e-7909-4fb8-b06a-1d23249c66cf","resolution":{"observed_at":"2026-08-06T21:56:38.187811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:25.486598Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:25.486598Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:8163c00977354a4f798134425ddcd8d86238af8e6882f7754e5c2d82a5aec142","observation_id":"e9c86d0c-469f-4e15-a638-7c5e9aaf6a7f","resolution":{"observed_at":"2026-08-06T21:56:25.486598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:38.008317Z","title":null,"venue":null,"work_id":"786bb207-d7e1-454a-9153-39ef8743491a","year":2017},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:25.562626Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:13f853d0291cdc9e038dd0b3014138edc588ac516448365183f9c1d52890845c","observation_id":"faeb87cd-9fc5-4c4b-90af-cca206337995","resolution":{"observed_at":"2026-08-06T21:56:38.070806Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:37.870126Z","title":null,"venue":null,"work_id":"cbcd341e-82ca-450b-ad2c-fc98711dab66","year":1996},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:25.585099Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:c2edbe7cee3a8372eb743a57ceadde22881e7ca166225bc169f522b85a0b9a29","observation_id":"7807b8e9-4c65-42a1-bec4-c00f2167a217","resolution":{"observed_at":"2026-08-06T21:56:37.950802Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:37.767504Z","title":null,"venue":null,"work_id":"0e299f0f-dd97-4b80-972b-437b5be44580","year":2021},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:25.640654Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:a216448f5e431d2cc49edefbc9eb2ebfea6df20c33fe0ea5b2a16f1aa03e6300","observation_id":"c77720a7-fb58-40a6-ae7d-e8061737744f","resolution":{"observed_at":"2026-08-06T21:56:37.803676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T21:56:25.748740Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:25.748740Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:493945fbf1a216f253620b08165fd8ddfa76522128caa740c49039ba39c8a1b2","observation_id":"2f3b88ae-3f82-434d-8c78-33a0be994031","resolution":{"observed_at":"2026-08-06T21:56:25.748740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:37.551089Z","title":null,"venue":null,"work_id":"0934c791-5fc7-4b4e-95c4-5c03c3b15e63","year":2022},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:25.856351Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:c157a8f4b9d4ddd1cbfaa1ecde9a22a157be58671462eef79d26dc5eca6b6ac7","observation_id":"c2d4f3bf-0ded-4551-920d-93a332348fd2","resolution":{"observed_at":"2026-08-06T21:56:37.662766Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08331","last_updated":"2021-09-17T02:56:10Z","snapshot_observed_at":"2026-08-10T23:02:00.958552Z","submitted_at":"2021-09-17T02:56:10Z","title":"Accelerating Offline Reinforcement Learning Application in Real-Time Bidding and Recommendation: Potential Use of Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.08331","snapshot_observed_at":"2026-08-06T21:56:25.931462Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:25.931462Z"},"links":{"cited_paper":"/paper/2109.08331","citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:cd51662d9021a64945ba9afb4664203a57f775a8aa439da9b90be1cb7f8fd8b2","observation_id":"cba6578a-fae6-4eb5-a491-611ddce32a77","resolution":{"observed_at":"2026-08-06T21:56:25.931462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:37.431188Z","title":null,"venue":null,"work_id":"650028c6-b612-44a2-a201-80f11b31fc03","year":2024},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:25.999919Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:5036dcc5dd4fd672034feb1eebe8e3186939db576182e32d14769a0b2b6b6935","observation_id":"7f7cf6f9-816a-4743-ab62-f7dca37c6662","resolution":{"observed_at":"2026-08-06T21:56:37.497802Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-06T21:56:26.066022Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:26.066022Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:658d7abb8fcff3ff7b0d68488f372bde5e25b3b9559c69784c9d441bdb010933","observation_id":"b4b20dd4-378a-41fd-b838-11de970431b4","resolution":{"observed_at":"2026-08-06T21:56:26.066022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15326","last_updated":"2023-07-28T06:04:46Z","snapshot_observed_at":"2026-08-13T10:45:43.832729Z","submitted_at":"2023-07-28T06:04:46Z","title":"Staging E-Commerce Products for Online Advertising using Retrieval Assisted Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15326","snapshot_observed_at":"2026-08-06T21:56:26.144948Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:26.144948Z"},"links":{"cited_paper":"/paper/2307.15326","citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:69fd35ee6eb765b8059d3bf135785584d8c462c9dda1599b9c98e4d56b716b4a","observation_id":"f43ab6d2-3277-49bc-9e86-444f8eed64fd","resolution":{"observed_at":"2026-08-06T21:56:26.144948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:37.314571Z","title":null,"venue":null,"work_id":"d1a99cb9-d6a3-4d26-96d5-880c9a897314","year":2019},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:26.192718Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:fc88d456c737cb0b00f0ecedbcff6b879d9f7bc15b1f6d7502b31188774dc58e","observation_id":"c05eab26-5c6a-40f5-a4a1-9d056230f9c7","resolution":{"observed_at":"2026-08-06T21:56:37.374001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:37.130123Z","title":null,"venue":null,"work_id":"03df5918-cabb-4ee7-8fe0-08496bda63fe","year":2020},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:26.259054Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:49d6e86d7f13987d1d793b103524e0ed37ae1cad735992e17a0dba5ab281b431","observation_id":"3dd15638-198a-493b-9df9-66873331126b","resolution":{"observed_at":"2026-08-06T21:56:37.233915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:37.033475Z","title":null,"venue":null,"work_id":"236117b4-5d70-435d-9cf5-6847be06fa0b","year":2020},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:26.379961Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:217ad2f0e79c3b46edf3ac50db4e0d51f855ecec17da426b814afe2767688f8a","observation_id":"0018f75a-671f-46dd-9e7b-7abdd8acdf1b","resolution":{"observed_at":"2026-08-06T21:56:37.093049Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:26.507766Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:26.507766Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:efcc7efbd0915f2d333e82eb21ba0a64510a90fd9d472143c7923b5ee2093e8b","observation_id":"fec9a6b1-c777-45e1-bb07-068e453895c7","resolution":{"observed_at":"2026-08-06T21:56:26.507766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:26.545659Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:26.545659Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:d8ae19b1f9d2b686fa4fd0a16b39706806a327cb880c839955b50fe04e4445b7","observation_id":"43b5da70-898f-417d-9e13-692f5644833a","resolution":{"observed_at":"2026-08-06T21:56:26.545659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:36.895865Z","title":null,"venue":null,"work_id":"b374ee73-cc8f-4fbb-9085-32a9c5a22506","year":2022},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:26.643604Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:3aacff830bbfded5bd29ed30e625959f6138c00ed26039a37baa3d05f352bdac","observation_id":"e798bfa2-1387-4492-83a4-5697b44d8513","resolution":{"observed_at":"2026-08-06T21:56:36.931581Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:36.769265Z","title":null,"venue":null,"work_id":"aad0c12a-5ed1-49a8-b883-57f2f3d717af","year":2014},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:26.754308Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:7cbe87a0731f8e924d9cfbfe3321e3f8c45574818b1a68a81e69e6a581541e91","observation_id":"02fe5416-95aa-4f39-af34-313c9badd350","resolution":{"observed_at":"2026-08-06T21:56:36.844188Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:26.824946Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:26.824946Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:1608e301178975f1c278fdf06b421cf58248de6e87e51345e6e778b4bbbe7bd1","observation_id":"3524868f-d24f-4619-a192-7cbe5760a225","resolution":{"observed_at":"2026-08-06T21:56:26.824946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:26.872797Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:26.872797Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:64af3ffe568a95a698d943befdc9b72920183c23ca6fe05fc3de8ecec247d671","observation_id":"0f51c546-ada3-4702-9b81-94dc83d1c5a9","resolution":{"observed_at":"2026-08-06T21:56:26.872797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05591","last_updated":"2025-01-09T21:53:03Z","snapshot_observed_at":"2026-08-13T19:23:46.086654Z","submitted_at":"2025-01-09T21:53:03Z","title":"Session-Level Dynamic Ad Load Optimization using Offline Robust Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2501.05591","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.05591","snapshot_observed_at":"2026-08-06T21:56:31.092951Z","title":"Session-Level Dynamic Ad Load Optimization using Offline Robust Reinforcement Learning","venue":"cs.LG","work_id":"58bdc1b2-86e9-42a7-b03d-a7d55bbf70c4","year":2025},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:26.949145Z"},"links":{"cited_paper":"/paper/2501.05591","citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:e14edadf81289fe32c90451ec8fbc65d9dcf96b55af48a15175ddca6b4ead3c4","observation_id":"35727ba7-724b-4609-918f-1867b6c78d1e","resolution":{"observed_at":"2026-08-06T21:56:31.156043Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.06602","last_updated":"2022-04-16T10:53:12Z","snapshot_observed_at":"2026-08-13T16:41:54.848240Z","submitted_at":"2022-02-14T10:44:41Z","title":"Neural Re-ranking in Multi-stage Recommender Systems: A Review","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.06602","snapshot_observed_at":"2026-08-06T21:56:27.006707Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:27.006707Z"},"links":{"cited_paper":"/paper/2202.06602","citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:77847a19dac0f0e5e9a27381702d194967e59cdf546d0fff996023b47c576d19","observation_id":"86c3817e-4d2f-4807-a96f-6e3003964a4f","resolution":{"observed_at":"2026-08-06T21:56:27.006707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:36.552921Z","title":null,"venue":null,"work_id":"d91f6e3c-2cab-4724-9f79-271e7210996d","year":2021},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:27.045820Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:b97141d036f239474ad199806c2fc7bcf53e6702c30b037e0b72ff78ba3a9ddf","observation_id":"541ab415-ee86-4795-80e9-675c4e3c957f","resolution":{"observed_at":"2026-08-06T21:56:36.632636Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:36.321914Z","title":null,"venue":null,"work_id":"c6879f09-f997-4bbc-a325-865e35410e15","year":2024},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:27.149943Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:aeeafd630eee6cd1030ba5a357f8a8a2f045145b4cb2350bb4a0092541437c1e","observation_id":"6b30bc87-5488-4207-a171-786dc78128b7","resolution":{"observed_at":"2026-08-06T21:56:36.441903Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:36.129595Z","title":null,"venue":null,"work_id":"b7b4c57e-961d-477f-ba1b-3f8ce6e663dd","year":2023},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:27.227732Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:39a9af29616973c73ce8b6999456e8b53a6b20123cfefb2ff7faddda14a8c057","observation_id":"0e23b9bc-ea56-46f8-adba-1eb27d35364e","resolution":{"observed_at":"2026-08-06T21:56:36.230341Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:35.918606Z","title":null,"venue":null,"work_id":"d27725d6-ec75-407d-9595-82e7659ba341","year":2013},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:27.293044Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:441f4f5a0d167158375f9be9511e6fb0a1a7ba2ad640ce75071b9f6f30f30cf8","observation_id":"a5260736-15bc-4473-a948-fb41c33000e5","resolution":{"observed_at":"2026-08-06T21:56:36.000974Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:35.770819Z","title":null,"venue":null,"work_id":"5de1d063-2ecc-4346-a665-9c719f59a3ab","year":2018},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:27.357245Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:97d8460932cbb58c5ebd08bc77134e25939c928fd7bfb252a363f9607235ce15","observation_id":"a79bfa22-5146-4986-896b-424f2ff5490c","resolution":{"observed_at":"2026-08-06T21:56:35.850291Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:35.673779Z","title":null,"venue":null,"work_id":"58d76886-6c00-4023-9bbd-4cb5387054f2","year":2019},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:27.415883Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:32cd82cdc65ad3060c68ba377e3d69ec4b1cde44a07409f2a0004a5893f063f1","observation_id":"28fc7f27-863f-4036-9368-eab461a7bb5d","resolution":{"observed_at":"2026-08-06T21:56:35.727229Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:35.540126Z","title":null,"venue":null,"work_id":"74cc5c47-d271-4481-afc8-ebd3b91efe5d","year":2021},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:27.477077Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:af5422cf951208887ed43e9c60f0187ff6cb47bd96d3d1b5d889325c2fd841fb","observation_id":"a5362754-b528-465e-b80f-57a3247f66b9","resolution":{"observed_at":"2026-08-06T21:56:35.608016Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:27.547056Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:27.547056Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:cec40aeb870907472b440d2852368a1bf09884cbea92c11a48ba662c25051143","observation_id":"8bca2779-07db-4dd4-b37c-80265fe70a20","resolution":{"observed_at":"2026-08-06T21:56:27.547056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:27.615627Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:27.615627Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:acf3ba208fd23c7d4ccad8a50c289818b7e745827472972d7d5b1b2f0a011c36","observation_id":"a24a0b37-44b4-4675-a751-2f19eb6fb968","resolution":{"observed_at":"2026-08-06T21:56:27.615627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:35.409973Z","title":null,"venue":null,"work_id":"8e859890-482e-436f-859e-e176b5039bfe","year":2018},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:27.704004Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:4851273f92b222672062eb0e4366a62b35096e4d8abc9473725dc09bbbc15761","observation_id":"2d9f5dbc-9ea1-457c-b543-c50c1b389c56","resolution":{"observed_at":"2026-08-06T21:56:35.449317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:35.254467Z","title":null,"venue":null,"work_id":"8dcf916f-2d3e-441d-8ccc-52e560906e06","year":2016},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:27.773071Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:e849a1e70da774c8f22f5318f8736babe84196f9357a947bc277b1d95df9539e","observation_id":"44474029-1767-4100-8abe-4b6ebb61d32a","resolution":{"observed_at":"2026-08-06T21:56:35.309987Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:35.134881Z","title":null,"venue":null,"work_id":"b09e78d6-8672-47fc-8bf5-1de0163e2f9d","year":2021},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:27.797893Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:02ada957d73ff14795b3cdbb424a0c19684a19cf9dc920f1f497651eb89adc21","observation_id":"92a1cbb9-129b-4080-a70c-26060bec9aaf","resolution":{"observed_at":"2026-08-06T21:56:35.180951Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:35.017555Z","title":null,"venue":null,"work_id":"7daa712a-12bf-4c05-bb98-77160409b109","year":2019},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:27.799845Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:730766d08f95baaaf169853c483e2c01d0a38b7f97e639c3cbda90976f5855b3","observation_id":"680f26fa-7460-4ff8-8b95-8b10f6080982","resolution":{"observed_at":"2026-08-06T21:56:35.076013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:34.839087Z","title":null,"venue":null,"work_id":"2a185498-38d7-4bd1-b013-011bc32c6756","year":2012},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:27.801800Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:cff056f4e07bc191bc00a102f1cbb6676f4161ae38682eae3895a3e6903597ff","observation_id":"1dede568-0693-4961-bf01-4bd1b29c8ecb","resolution":{"observed_at":"2026-08-06T21:56:34.940789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.11074","last_updated":"2018-12-26T11:09:40Z","snapshot_observed_at":"2026-08-13T19:08:07.087878Z","submitted_at":"2018-05-28T17:31:11Z","title":"Reward Constrained Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.11074","snapshot_observed_at":"2026-08-06T21:56:27.805236Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:27.805236Z"},"links":{"cited_paper":"/paper/1805.11074","citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:a082a01b90b08a606fe732694d614c4107f4359f9ea6b5a9bdccc44664c41c6c","observation_id":"f8e71de4-f3a7-4b6f-8a9b-2438d7ae7901","resolution":{"observed_at":"2026-08-06T21:56:27.805236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:27.853103Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:27.853103Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:4aa7abfde7bded5183eb3c2be92871e78236f5301ccfd15c1ca46144f606bd78","observation_id":"5b094fdd-7d59-4239-aa21-d877976733dc","resolution":{"observed_at":"2026-08-06T21:56:27.853103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:34.619961Z","title":null,"venue":null,"work_id":"9e1ad73c-c9a9-4abd-8f75-29738944813a","year":2023},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:27.936951Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:a62b6cb8fe0cf2e7b4b4b92395838d00a5292c283c5a7f7db9121ee6dd12db05","observation_id":"435b93f3-777c-4d67-9a1e-aafdbc1e3b1c","resolution":{"observed_at":"2026-08-06T21:56:34.754797Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:28.030982Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:28.030982Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:eb9807c49ef0dda3d4ed7b6f58be8560f9b4bed85cc03b493840400548c62439","observation_id":"f4e24023-d07e-4d05-81d2-9defc8f3c387","resolution":{"observed_at":"2026-08-06T21:56:28.030982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:34.353441Z","title":null,"venue":null,"work_id":"f6595b91-ecfd-4452-9616-67f766cc13fb","year":2012},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:28.113675Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:977969f34bb2c345b6206f9a4045534f24c540aecbfc2d2249267cca87dc75d6","observation_id":"c8d08bbe-3db2-4c05-b5b2-36c84e92611a","resolution":{"observed_at":"2026-08-06T21:56:34.498932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:34.020367Z","title":null,"venue":null,"work_id":"db463f98-3f12-459e-8411-9c38622e0841","year":2019},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:28.201204Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:32169f6375730d8be4de167cb907d3030ebdeba37fb56ad01933884be5406d91","observation_id":"f9b57154-2cb6-4ca6-92ed-8ffd6f7311c2","resolution":{"observed_at":"2026-08-06T21:56:34.153077Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:33.844816Z","title":null,"venue":null,"work_id":"58a98532-4120-4425-86d5-e94cf4501e20","year":2023},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:28.281014Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:c2135ad5798303603c5df55882b577dd04410c6b963febb5baa43c9dcd2e0424","observation_id":"8c031cce-aaff-4b41-ad0c-ca902f566a4d","resolution":{"observed_at":"2026-08-06T21:56:33.908198Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:33.693129Z","title":null,"venue":null,"work_id":"adda72e7-ae4b-4723-84f1-21e225f769bb","year":2022},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:28.407465Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:8de48f1b9624a5f86d45f6fff6b6acc7252f08cecff98333f1af057a89a5f2f1","observation_id":"1a8f4bac-8c31-4853-8cfc-12ab7cb877eb","resolution":{"observed_at":"2026-08-06T21:56:33.762159Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:33.511316Z","title":null,"venue":null,"work_id":"a98e0385-b671-47d3-97b8-806579e8eda8","year":2017},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:28.545645Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:a0cc5e4a4b0776bdfcb4dc35aad691ef4659a0fa5d23299a756bbde5d9515a88","observation_id":"9ccf651d-1f30-4f05-bb35-ba6b7a6d71d7","resolution":{"observed_at":"2026-08-06T21:56:33.614351Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:28.686008Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:28.686008Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:8571246ae1a01d1415b3770d2b858e08879eb9fce1b7da5b358338ac712dfa41","observation_id":"720274d6-a44a-4b13-86d3-8eb2bae121e2","resolution":{"observed_at":"2026-08-06T21:56:28.686008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:33.360762Z","title":null,"venue":null,"work_id":"2dedede7-278e-4198-8aaa-3a686a1283b5","year":2020},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:28.830151Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:813f52f4ab2349640eef975a79b3a1899c5aaafc7e86b24f44cc863092de4e4a","observation_id":"25bd65cd-88d3-45b7-8f65-38dd20ff2cd9","resolution":{"observed_at":"2026-08-06T21:56:33.422129Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:33.181955Z","title":null,"venue":null,"work_id":"811802b5-44ec-44a5-8138-89e541dd85d9","year":2009},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:28.941755Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:ca1ef08bce5c79fce705d8ee8d8ed07891a86f11a8e97a3fd5faee4b352079dc","observation_id":"a1107628-b3c6-40ab-9f97-5f8cf7108803","resolution":{"observed_at":"2026-08-06T21:56:33.273078Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:32.972828Z","title":null,"venue":null,"work_id":"18dc456a-9df2-4fe4-9530-dc7689455f57","year":2021},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:29.029988Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:436e9f06c4d118d9f97564a9075d30c49ce26fcc1c48f485713baa8f4dd5daea","observation_id":"8f10aba1-aba0-4231-9612-6ecc8fb5fb96","resolution":{"observed_at":"2026-08-06T21:56:33.073079Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:32.758323Z","title":null,"venue":null,"work_id":"1b3f7a8c-43c2-42e3-abcc-8600d65e875d","year":2018},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:29.152833Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:8e03186f9e577bb6ac09d3558fc8f150d88040c1dc1a428cc80ebe66294d6daf","observation_id":"7671a956-f67c-4631-b969-bd2ce630bf76","resolution":{"observed_at":"2026-08-06T21:56:32.848783Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:32.587315Z","title":null,"venue":null,"work_id":"200d17cf-84b5-4597-b5f9-d09a2517fdce","year":2023},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:29.291669Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:7ebd966f1623e2d57ec5c3ce34c9a1dab6b00e75997ef1c02d320eee7f4935c0","observation_id":"962f6c1a-c186-4894-b355-d6cbe6cdeac7","resolution":{"observed_at":"2026-08-06T21:56:32.663873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:32.493593Z","title":null,"venue":null,"work_id":"8ef047ef-4dd7-4af4-b7ce-64329a7c5405","year":2022},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:29.443063Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:e2d3145533f71a45ac2d09dc1de835f9e06ce6418872151a2e9620b49ead3c23","observation_id":"93fea43c-9721-4003-baad-221dae2bb195","resolution":{"observed_at":"2026-08-06T21:56:32.531520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:32.323037Z","title":null,"venue":null,"work_id":"3216cf43-a181-44eb-9691-0e9451a35d4a","year":2021},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:29.595768Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:e4d12f3757860fa89c0ea4ca0b2ed2cec0fbf6b1ecfef65a3b92874cc74ad552","observation_id":"1e092b40-0d53-43ed-8fdd-910c343395c6","resolution":{"observed_at":"2026-08-06T21:56:32.420199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:32.186157Z","title":"Deep reinforce- ment learning for search, recommendation, and online advertising: a survey","venue":null,"work_id":"34053115-54ae-4716-b0a8-26ee5e77229d","year":2019},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:29.754143Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:e7a3d06a10c081a44ec7cd477bd370926bc5b8d139f33e0264051ba48c9d4316","observation_id":"53e58523-403d-4793-8076-9c0695962e40","resolution":{"observed_at":"2026-08-06T21:56:32.264919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:29.888264Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:29.888264Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:cdb76cde27d2fd46deb7ac433583ad18f9ebeb5a635861a337825dfeaba16769","observation_id":"4e3a2c18-4a03-4721-95dd-be00480f8f37","resolution":{"observed_at":"2026-08-06T21:56:29.888264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:30.034757Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:30.034757Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:c015caec728f2484a2e2710d32fb3e0fbae0cfabcec45606f449e298b6b2e99c","observation_id":"fa11ca22-e8e1-49cb-adc3-baaf4163a711","resolution":{"observed_at":"2026-08-06T21:56:30.034757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:32.055685Z","title":null,"venue":null,"work_id":"f797ff2a-a476-48c8-9224-2d00b1d7f475","year":2021},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:30.121950Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:4e7367bf7eb33fd1e372a1b8a90787b7470ade4a21f5c25d127cd80d1a5e0839","observation_id":"42845379-9004-4aaa-ae8c-2da519fa1709","resolution":{"observed_at":"2026-08-06T21:56:32.110626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:30.188091Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:30.188091Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:33d679f63bcaabcfa06df53c20d82846fc6b7ecb4581b25c249ebede9025e43b","observation_id":"005f0d08-b4a8-4a5f-8c59-79900ffcd812","resolution":{"observed_at":"2026-08-06T21:56:30.188091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.00209","last_updated":"2019-06-27T06:29:27Z","snapshot_observed_at":"2026-07-06T06:16:41.305533Z","submitted_at":"2017-12-30T23:30:36Z","title":"Deep Reinforcement Learning for List-wise Recommendations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.00209","snapshot_observed_at":"2026-08-06T21:56:30.349997Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:30.349997Z"},"links":{"cited_paper":"/paper/1801.00209","citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:ad522f1da0cd9725e8d5078a08a431cb6c4c6bd6e4bf24cd99df532ab81bc22c","observation_id":"9d539f6e-e28a-47b7-89fd-0bbe6bb153c1","resolution":{"observed_at":"2026-08-06T21:56:30.349997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:30.476821Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:30.476821Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:933acc910e2c98a240daa25caad4cfe1a4dfd5e5c1677fabb8e35ae6ab6289bd","observation_id":"25787cd2-6d86-4a47-bbd6-6070cc3aa5ef","resolution":{"observed_at":"2026-08-06T21:56:30.476821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:31.700899Z","title":null,"venue":null,"work_id":"2934b8b6-66c3-45a8-9385-146559a1b640","year":2022},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:30.659368Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:6dae470fabe87c7fe503b5d0b13c4fe29a87d5024f304164599a9aed7120248d","observation_id":"9ccb08d8-543f-4213-90c4-b19a97996db9","resolution":{"observed_at":"2026-08-06T21:56:31.803270Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:30.804269Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:30.804269Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:7ac6d067681294e1103308d285913912efa7835971e53bb660d42c653e864565","observation_id":"ab5840fa-13af-49e8-af6a-9aef54221292","resolution":{"observed_at":"2026-08-06T21:56:30.804269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:31.543894Z","title":null,"venue":null,"work_id":"16b7fb64-5cea-4f4f-8306-83db633cb34a","year":2023},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:30.907292Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:090f2053130ed710be6c3b3f1ee407b84e6f9817288419d0d88667225d791276","observation_id":"73e675d3-26c3-4fbc-a0a9-a10521a92b26","resolution":{"observed_at":"2026-08-06T21:56:31.634928Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:23.805025Z","title":"In Proceedings of the 1st workshop on deep learning for recommender systems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:23.805025Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:791e92bd7d8ccdb1dd6cf9d054512475f5b4d804fb3a331b57971198eb46ef1d","observation_id":"b765e973-a56f-4e10-97db-2d3c86713bc5","resolution":{"observed_at":"2026-08-06T21:56:23.805025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:30.260036Z","title":"In Proceedings of the 24th ACM SIGKDD international conference on knowledge discovery & data mining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:30.260036Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:e2c2656f2d6d30fb500f807d9d1518ac741a849cd9b481289836c7239307de9f","observation_id":"41a9fd58-228e-4f45-ac11-6f04e9d8280d","resolution":{"observed_at":"2026-08-06T21:56:30.260036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.13286","last_updated":"2019-09-19T13:50:40Z","snapshot_observed_at":"2026-08-11T05:24:57.406254Z","submitted_at":"2019-07-31T02:23:52Z","title":"The Unfairness of Popularity Bias in Recommendation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.13286","snapshot_observed_at":"2026-08-06T21:56:22.068174Z","title":"arXiv preprint arXiv:1907.13286 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:22.068174Z"},"links":{"cited_paper":"/paper/1907.13286","citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:02b15a5b98eb8b676ddb007ed3318bbd18c22f23eaf9a246cf02a8aa2ce7500a","observation_id":"09f5c01c-8c0a-4d14-8ce1-0cd9e9a5e447","resolution":{"observed_at":"2026-08-06T21:56:22.068174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:56:31.907722Z","title":"In Proceedings of the 26th ACM SIGKDD International Conference on Knowledge Discovery & Data Mining","venue":null,"work_id":"a607c61b-2f1a-4ec9-a8bb-c0e34f01c2c1","year":null},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:30.579926Z"},"links":{"citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:887850b6f89ab2df38315f26c1832529fdc29ed96e8b8e75e1c7006e65c5baf9","observation_id":"586eca01-a073-40d8-997a-0ddaec462730","resolution":{"observed_at":"2026-08-06T21:56:31.996108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.03540","last_updated":"2021-09-09T10:16:31Z","snapshot_observed_at":"2026-08-13T18:15:21.640250Z","submitted_at":"2021-09-08T10:44:55Z","title":"A Survey of Deep Reinforcement Learning in Recommender Systems: A Systematic Review and Future Directions","version":2},"cited_work":{"arxiv_id":"2109.03540","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.03540","snapshot_observed_at":"2026-08-06T21:56:31.355053Z","title":"A Survey of Deep Reinforcement Learning in Recommender Systems: A Systematic Review and Future Directions","venue":"cs.IR","work_id":"21e9ac23-19e8-432c-90d7-8e997d81ab0a","year":2021},"citing_paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T21:56:23.598622Z"},"links":{"cited_paper":"/paper/2109.03540","citing_paper":"/paper/2506.23090"},"observation_digest":"sha256:577fdd4f04e1fedeb2864872ca65cdd1ba7024a63b8e41ecc21bbdd8d2c39081","observation_id":"acc12d4b-4d3a-46cd-8a8d-977928b0369e","resolution":{"observed_at":"2026-08-06T21:56:31.419902Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23090","last_updated":"2025-07-09T09:50:43Z","latest_version":2,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-07T08:34:23.676501Z","submitted_at":"2025-06-29T05:05:13Z","title":"Multi-task Offline Reinforcement Learning for Online Advertising in Recommender Systems"},"reference_resolution":{"displayed":98,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":94,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":98},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 0 inbound Pith citation observations for arXiv:2506.23090."}