{"as_of":"2026-08-15T17:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:15d431b1be7a8a7cc7ed69395fa2ed049a52fd4df05932c03009a90346ba6e75","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:52:51.209612Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.10381/citation-record","integrity":"/paper/2412.10381/integrity","json":"/paper/2412.10381/citation-record.json","paper":"/paper/2412.10381"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:50.901529Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.901529Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:7c01ba5e915b3a1613d7e2c116ff7ac126174f43e4e3cccb229a0198ca26944d","observation_id":"64f099f3-d1f3-4328-8012-531c454297fb","resolution":{"observed_at":"2026-08-12T10:52:50.901529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.369786Z","title":null,"venue":null,"work_id":"fe64f356-e6ee-470b-b6fb-b05a18f5e3b2","year":2021},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.907979Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:5ce5e49773c44cd254481aee549d7f4262fae17eae56b7a96a7224b3789851bb","observation_id":"1fff39fd-578e-4e45-acd4-03e000d6abd1","resolution":{"observed_at":"2026-08-12T10:52:52.376885Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.348599Z","title":null,"venue":null,"work_id":"5d655664-4dfb-4c3c-9019-0f5871bde7b8","year":2017},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.913593Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:60dccadd77e97681364083dc9b753dce8b3231bb914d6381121fe5133a7760aa","observation_id":"01d9a52f-8e31-4e17-82b0-193706de622d","resolution":{"observed_at":"2026-08-12T10:52:52.355104Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-12T10:52:50.919588Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.919588Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:31761746e4727ff423de4f7768e628ec13cc82fee9a81b9b5eb42efa587ca0ab","observation_id":"9065f912-361a-4080-a59c-89582523c400","resolution":{"observed_at":"2026-08-12T10:52:50.919588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.328373Z","title":null,"venue":null,"work_id":"5bf6d895-092e-43f3-8f27-a1f9b6e769fe","year":2023},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.926219Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:ea85dfea4b95099eeb54b92e5fad07757adeef86bff3063aadb81ac2b74071d4","observation_id":"457ce9d4-3850-4ac9-8573-b0578d12aed4","resolution":{"observed_at":"2026-08-12T10:52:52.335055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.302403Z","title":null,"venue":null,"work_id":"1ed1b80c-3f74-4c02-bcd3-b399ed029a82","year":2020},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.931939Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:7d7f828e5e9ffbdc4a2ca9bf081985470f49f270e38a13416ed29ddd0283fd84","observation_id":"cb652757-3e23-4d7a-ad9a-7df23c1216fb","resolution":{"observed_at":"2026-08-12T10:52:52.308969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.276021Z","title":null,"venue":null,"work_id":"3662cd27-4ce1-48d0-979c-9f2d5875ab8a","year":null},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.938389Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:baefa963902998e7469ec54ef59f453fe5558f6c45b9e611e2ab63d1951462be","observation_id":"dee0befc-c6ff-4548-845e-ce42d33ee679","resolution":{"observed_at":"2026-08-12T10:52:52.288283Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03732","last_updated":"2019-10-09T00:45:53Z","snapshot_observed_at":"2026-08-15T17:21:21.058474Z","submitted_at":"2019-10-09T00:45:53Z","title":"Ctrl-Z: Recovering from Instability in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"1910.03732","doi":null,"metadata_source":"pith","pith_arxiv_id":"1910.03732","snapshot_observed_at":"2026-08-12T10:52:51.606925Z","title":"Ctrl-Z: Recovering from Instability in Reinforcement Learning","venue":"cs.LG","work_id":"064558ea-7e6e-400b-9887-f56cb2e9d90f","year":2019},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.950100Z"},"links":{"cited_paper":"/paper/1910.03732","citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:abe600f6266f8e67b12c17c5efb3c67a5b8fa249fbd4b47b60d97cd66fd7a66a","observation_id":"a9908d34-5b8a-4ceb-b493-7461b271111a","resolution":{"observed_at":"2026-08-12T10:52:51.616774Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.256261Z","title":null,"venue":null,"work_id":"0f150a55-de42-4704-b0b3-107a24edd9ed","year":null},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.955840Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:4e526d82677601f2ad5e5f6149639d779984beaee655fbeb5a0466c4913fc863","observation_id":"e57e0058-f304-4c05-bc30-16dc62bbca8a","resolution":{"observed_at":"2026-08-12T10:52:52.261799Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.208300Z","title":null,"venue":null,"work_id":"7bbb7680-2d6f-4b71-b0da-1d9f80e81634","year":2023},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.969876Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:f3c31e1f64e7661697bfc4561235703ccb36e98feb83bcb2e5b6ce79b78bdf26","observation_id":"cc3a6e52-a5f8-4c7f-9da5-5d5ed96e69d8","resolution":{"observed_at":"2026-08-12T10:52:52.215296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.02011","last_updated":"2016-01-20T10:33:00Z","snapshot_observed_at":"2026-08-14T22:19:44.449737Z","submitted_at":"2015-12-07T12:25:18Z","title":"How to Discount Deep Reinforcement Learning: Towards New Dynamic Strategies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.02011","snapshot_observed_at":"2026-08-12T10:52:50.975419Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.975419Z"},"links":{"cited_paper":"/paper/1512.02011","citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:98edb9437d1ce145fd9f6e99766716858e63d08553085221b6ce42f5cd29062d","observation_id":"e87f761e-5451-4632-8dc7-05c2491bfcf2","resolution":{"observed_at":"2026-08-12T10:52:50.975419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:50.981032Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.981032Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:1fc11e7cdcb53328dfa6f51ef9c2b4e2f4c008db5d1c264d63c808e7d6d4bc12","observation_id":"430a1f3e-aa52-48e5-9780-1553eb46451b","resolution":{"observed_at":"2026-08-12T10:52:50.981032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:50.986616Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.986616Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:34132ee30635ab51e106d0414b8c7a9ce0d86aaff4680c96abe943f8bcc3e03a","observation_id":"a9ec3a37-7a2f-4e26-81e7-3cb8cc67aae1","resolution":{"observed_at":"2026-08-12T10:52:50.986616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:50.994745Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.994745Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:90759e71af311bd9095c59c8de7fbfb9ed1c3e6aa2a56cbfc589ba432f3897e6","observation_id":"56b63171-ae52-4571-b2dd-dc2b1dd07f9a","resolution":{"observed_at":"2026-08-12T10:52:50.994745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.146235Z","title":null,"venue":null,"work_id":"7ad71d6a-9376-41dd-b8c0-d2a0407bccca","year":2004},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.999753Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:e90ce786d05bc18859183f654b375db12f46c385128485b27e7e4d23ca0dd472","observation_id":"89f5ebd3-5c39-4406-87e7-c4aeb4e1b1c5","resolution":{"observed_at":"2026-08-12T10:52:52.153821Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.005598Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.005598Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:4a670c126d616ce1627cd537fde60fbfdbd49cb969ac851524be983e78dd7257","observation_id":"3ab226f2-bbe4-4cbe-96ea-99c62b875988","resolution":{"observed_at":"2026-08-12T10:52:51.005598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.112191Z","title":null,"venue":null,"work_id":"723fbfd0-3e1c-4de4-94c9-3b81f63fd260","year":null},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.012045Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:87da70818a3d4a78416df90350cda845b8762a6150df3900ae72f6bcedff6e41","observation_id":"efeb99d1-5b41-4865-b5f1-0bd44608f900","resolution":{"observed_at":"2026-08-12T10:52:52.118216Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-14T22:57:08.956233Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-12T10:52:51.025778Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.025778Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:a5e1f8de1752798e5c578d49b49272d726d9445a804c5d36e7f72248194dde07","observation_id":"0fc87e8f-8cb7-4931-9698-422295d5a1e4","resolution":{"observed_at":"2026-08-12T10:52:51.025778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.032200Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.032200Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:63c145398de3543f9a1b41dc9c59b76dec3155c035d86cf3bce09f98d20250b0","observation_id":"4d466631-606a-4787-98f1-62ae1c57ea18","resolution":{"observed_at":"2026-08-12T10:52:51.032200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.037671Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.037671Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:399783cc2e57bea4ebffa0336f7b317c8fe8e3bb2d801355927b020ca0a47bb0","observation_id":"a7b9165d-6a91-4a6b-be18-0445fc3677dc","resolution":{"observed_at":"2026-08-12T10:52:51.037671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01144","last_updated":"2017-08-05T22:45:19Z","snapshot_observed_at":"2026-08-15T03:05:41.956181Z","submitted_at":"2016-11-03T19:48:08Z","title":"Categorical Reparameterization with Gumbel-Softmax","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01144","snapshot_observed_at":"2026-08-12T10:52:51.042612Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.042612Z"},"links":{"cited_paper":"/paper/1611.01144","citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:95e282436e44be64bf5a54787d09233366bb00973b5555fdb464cbee15468030","observation_id":"b2eea160-de8b-4fd3-adac-3e3160e27180","resolution":{"observed_at":"2026-08-12T10:52:51.042612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-12T10:52:51.048052Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.048052Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:59c94eb71db29ca77c9b99eaf3468f76d1b3c342164f05c8a4f247f14186fb32","observation_id":"20950dc5-63a0-4ffc-a921-a17b4d6c62b7","resolution":{"observed_at":"2026-08-12T10:52:51.048052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-13T07:57:56.087944Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-12T10:52:51.053319Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.053319Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:903a9c6bd259cdc79cf2acbf35cc1a2303c4101ebcabc4008666238c8e79f8b0","observation_id":"e5fbd000-6110-4d7c-be91-894da1a99800","resolution":{"observed_at":"2026-08-12T10:52:51.053319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.059103Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.059103Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:1e97c55da9b7235e2f709091f6fd4f3d1a0617863491e81ba97007f951c6333c","observation_id":"741ced39-92a4-4f54-8655-da519eea2461","resolution":{"observed_at":"2026-08-12T10:52:51.059103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.07274","last_updated":"2018-11-26T04:56:31Z","snapshot_observed_at":"2026-08-15T10:58:31.329286Z","submitted_at":"2017-01-25T11:52:11Z","title":"Deep Reinforcement Learning: An Overview","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.07274","snapshot_observed_at":"2026-08-12T10:52:51.064060Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.064060Z"},"links":{"cited_paper":"/paper/1701.07274","citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:10b630ed636eeb23cb13b60d49c127b1806c9324fd29ce077338bb274f5c7897","observation_id":"acc28442-5077-4a70-9de7-9417e2acb2c1","resolution":{"observed_at":"2026-08-12T10:52:51.064060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.070010Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.070010Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:4b96f351ef1e96e6b1e87dee07290a68635473fb98c1891ae5a83f8249478fa6","observation_id":"2a6dd38e-38a7-4e52-912c-c1b06da17367","resolution":{"observed_at":"2026-08-12T10:52:51.070010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-08-15T12:04:28.662048Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-12T10:52:51.075855Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.075855Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:f3f30a13333ae221cf02b333f2cb9bd4fdceedcef36cca9a856c766d92383f82","observation_id":"0bc94022-93e2-4ce4-97aa-c2acd243c02a","resolution":{"observed_at":"2026-08-12T10:52:51.075855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.081802Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.081802Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:51594018fcc7d2b9e337c4b8b5112155fd0305a9cccbb9a898a3fc96257f169f","observation_id":"39d264af-7691-4e38-bed8-49246624be64","resolution":{"observed_at":"2026-08-12T10:52:51.081802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.02264","last_updated":"2019-02-27T05:38:15Z","snapshot_observed_at":"2026-08-14T18:55:06.013975Z","submitted_at":"2018-07-06T06:03:06Z","title":"Variance Reduction for Reinforcement Learning in Input-Driven Environments","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.02264","snapshot_observed_at":"2026-08-12T10:52:51.086889Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.086889Z"},"links":{"cited_paper":"/paper/1807.02264","citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:8c740f354c661ac1a6e8747a3c841744f25e8218eb8f8610b94e48a530565979","observation_id":"2608cd96-7ecc-4ac7-856d-af1e39f510aa","resolution":{"observed_at":"2026-08-12T10:52:51.086889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.976696Z","title":null,"venue":null,"work_id":"97077b8e-03b4-433f-bdc6-161e1de5c6a2","year":2021},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.092765Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:e00ca6e8983542b473a0be698daf6df4f0f62500a5f2d264defc2ed2f589ed88","observation_id":"9f327761-2654-4db4-b769-26483708a99e","resolution":{"observed_at":"2026-08-12T10:52:51.983097Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-14T03:19:40.736445Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-12T10:52:51.098648Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.098648Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:2d6c17b93bc682dbd295bf010ff221dcd3c16d81288eb659ae749f43d0fef205","observation_id":"b18907ed-d891-4c8a-b115-96566cc2ec24","resolution":{"observed_at":"2026-08-12T10:52:51.098648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.105407Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.105407Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:62795899a7b9e5fe04b1aae5284e95673d3d1bca93112a5a1f5f1059f8656b8f","observation_id":"194adf29-264a-4641-adf2-90e49a3de292","resolution":{"observed_at":"2026-08-12T10:52:51.105407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-08-15T03:52:49.245753Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-12T10:52:51.111006Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.111006Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:cddc613c0d48e211c56ee54c8c8127c45ba3d358eaf044db8bdd5b69d35c6dcd","observation_id":"b491901a-80f8-419d-bf49-58afb7e334e5","resolution":{"observed_at":"2026-08-12T10:52:51.111006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.03359","last_updated":"2018-11-07T20:36:53Z","snapshot_observed_at":"2026-08-14T19:17:20.819506Z","submitted_at":"2018-05-09T03:11:29Z","title":"Reward Estimation for Variance Reduction in Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.03359","snapshot_observed_at":"2026-08-12T10:52:51.116862Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.116862Z"},"links":{"cited_paper":"/paper/1805.03359","citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:7d9e997031276c556fc7a81d3498476b334c0cc36fa907fb6af5dc2d4cfaf583","observation_id":"93686276-b083-4f0c-9aeb-d98005ba99b9","resolution":{"observed_at":"2026-08-12T10:52:51.116862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.943206Z","title":null,"venue":null,"work_id":"7020274c-97f8-432c-98b1-0bf06fec957c","year":2022},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.122380Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:c65449db6cb34d9a629e5400127da259691578c09ca7e31aed22ca00c765f85f","observation_id":"c205711a-8b0c-4f28-a82f-8d27c1ccf97a","resolution":{"observed_at":"2026-08-12T10:52:51.950675Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.127482Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.127482Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:14e6975c2617f671e6adcb37dc896e412e02d384fc376673b284b2cd018abbd1","observation_id":"aedf5ca5-e001-47a5-b4e8-65adedda267c","resolution":{"observed_at":"2026-08-12T10:52:51.127482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.905715Z","title":null,"venue":null,"work_id":"2bc63dce-6f5d-48bf-8db0-cb1eceb28740","year":2015},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.132451Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:3d3e1fc8e8d312a6b8c233597db4f20d9f95e10d77d9b115ff74e3902da38dfc","observation_id":"0e668155-11ca-4a0b-a9b3-57c0c80c826c","resolution":{"observed_at":"2026-08-12T10:52:51.912380Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.11074","last_updated":"2018-12-26T11:09:40Z","snapshot_observed_at":"2026-08-14T19:10:15.765536Z","submitted_at":"2018-05-28T17:31:11Z","title":"Reward Constrained Policy Optimization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.11074","snapshot_observed_at":"2026-08-12T10:52:51.137747Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.137747Z"},"links":{"cited_paper":"/paper/1805.11074","citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:1e53e674a2af80f7d79699dac96601a499eb699e1cbb99a185ed2f923dcf9ba7","observation_id":"5a53ca29-5fb1-4347-acf2-d8777189d23b","resolution":{"observed_at":"2026-08-12T10:52:51.137747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06355","last_updated":"2022-12-13T03:38:57Z","snapshot_observed_at":"2026-08-13T13:23:03.818353Z","submitted_at":"2022-12-13T03:38:57Z","title":"A Review of Off-Policy Evaluation in Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06355","snapshot_observed_at":"2026-08-12T10:52:51.143142Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.143142Z"},"links":{"cited_paper":"/paper/2212.06355","citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:abc112ed7c13c6532cd74c5996c3a116d0606892373c7efd603a55d138fa299e","observation_id":"28cd3a95-016f-47d2-9b2e-0b0a0477d58e","resolution":{"observed_at":"2026-08-12T10:52:51.143142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.148713Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.148713Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:3ade72fc05d20bc6673f1513ef397f090a4bdd2999cfd8d145c15f01b87893f4","observation_id":"9c748270-b810-4f92-ac84-43be5e3880e6","resolution":{"observed_at":"2026-08-12T10:52:51.148713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.153745Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.153745Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:c4f93dd2677c090d35c183b9af3ec25ba63aaa6c698c634a2d880c125218e79b","observation_id":"251134e3-50d4-4779-a7da-62f0010ccbdf","resolution":{"observed_at":"2026-08-12T10:52:51.153745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.855631Z","title":null,"venue":null,"work_id":"88055f8b-6bfc-4cae-86c5-6623657a408f","year":1989},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.159424Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:439bea629fb92fe06c28172b347e1298bf0fbef1f273428dfb996fe674f490df","observation_id":"21cd8c86-7b44-492a-b115-a1a615dae295","resolution":{"observed_at":"2026-08-12T10:52:51.861876Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.164950Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.164950Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:dc2826c55f5db4eb736963c7fd5062eac25629d8c4f2b8b869fa779441d0f0d2","observation_id":"bd92e0f2-d732-4f1a-b64c-f726ef3eff4b","resolution":{"observed_at":"2026-08-12T10:52:51.164950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.822809Z","title":null,"venue":null,"work_id":"45acea7e-0f45-4190-98d6-7cb346d905d2","year":2023},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.169848Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:01f9fce29e1f2f840364b38ec46dda177a131094510dc6326ffd7ccd3e30d925","observation_id":"5c500e15-1983-4475-8205-c2f384c432dc","resolution":{"observed_at":"2026-08-12T10:52:51.828248Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.802717Z","title":null,"venue":null,"work_id":"b0f2f225-9598-49cc-8fda-081d074482a3","year":2024},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.175416Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:08291fc01c257e1eb57a2ab6abc3295500017b67e2351184ff3e04f3ca15e619","observation_id":"525c036a-c1b7-427d-9eeb-e88e6470e9d0","resolution":{"observed_at":"2026-08-12T10:52:51.808445Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.780669Z","title":null,"venue":null,"work_id":"1f866432-c383-442a-a27a-a04cdf46f2a9","year":2024},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.181118Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:4cd9965307918dc27f27dcfb1c8c9ce2b670b5fbc9023622f527e4b09e41fd6a","observation_id":"ebe34c84-972f-4a3c-957b-fee4860a82e0","resolution":{"observed_at":"2026-08-12T10:52:51.787780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.754489Z","title":null,"venue":null,"work_id":"099273f8-6329-44ef-b6b3-6a4621b7c53b","year":2022},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.186571Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:68d7d3be4e45a0f891a150d96026be4684f5fbdd8ca93deb7a5019bdf76ff9cd","observation_id":"cdcbc178-addf-4ce1-b378-c66dd9573a49","resolution":{"observed_at":"2026-08-12T10:52:51.765193Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.192265Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.192265Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:d3cb8ef12208a972a985466a6e1b84330f57a5fec403832270ded02f97188850","observation_id":"ab8ac462-96d3-4e36-8936-6978ae73220c","resolution":{"observed_at":"2026-08-12T10:52:51.192265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.197266Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.197266Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:ae0a06951f4547a10a1b87192fea47b3f1f44906417a9d35f781d64688052a16","observation_id":"39e049ec-bdd2-4489-abaf-0b81759f2b43","resolution":{"observed_at":"2026-08-12T10:52:51.197266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.202675Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.202675Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:d33c58ddb1a633268e882f57b6ee255180a2fda908f17ddc24a33e353b1ee30c","observation_id":"27bc7b36-aa05-4d8b-b158-e70682cdce24","resolution":{"observed_at":"2026-08-12T10:52:51.202675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:51.677879Z","title":"In Proceedings of the 25th ACM SIGKDD international conference on knowledge discovery & data mining","venue":null,"work_id":"8818e521-659a-452a-b5de-8b1830192dc8","year":2025},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.209612Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:ed25666b2dfa81784e641273db7e0c3de0a028af53bec45e18277cb4afe4567e","observation_id":"04983ac8-997e-42c4-874c-1700b0970e6f","resolution":{"observed_at":"2026-08-12T10:52:51.685360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.084139Z","title":null,"venue":null,"work_id":"5c596c3d-bf14-431f-8ca6-da993f4c0add","year":null},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:51.018329Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:bd2268f73e176bd498c058a6858dc53d95df5a9847cd099bc8196a901c693ffa","observation_id":"d52705de-123a-4afb-9a1a-ae044374a580","resolution":{"observed_at":"2026-08-12T10:52:52.090556Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-12T10:52:50.944478Z","title":null,"venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.944478Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:c5664145629138d39b07b56b922615491da6653155a49635f397fb12cadf6b31","observation_id":"ea992a80-c1bd-4a3e-9791-c4d206ad2e72","resolution":{"observed_at":"2026-08-12T10:52:50.944478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:52:52.232588Z","title":"In Pro- ceedings of the Sixteenth ACM International Conference on Web Search and Data Mining","venue":null,"work_id":"a60095c7-3336-4fac-ab18-6a2a4d946adc","year":null},"citing_paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed","version":6},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-12T10:52:50.962597Z"},"links":{"citing_paper":"/paper/2412.10381"},"observation_digest":"sha256:0352b2df44165baffd3dd98377647295f81bcb54be3f1a71518a56bce2937eb1","observation_id":"34f6c823-0c9c-4129-990d-424bd042b821","resolution":{"observed_at":"2026-08-12T10:52:52.241482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.10381","last_updated":"2025-05-26T03:49:37Z","latest_version":6,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-15T04:03:52.427557Z","submitted_at":"2024-11-28T04:06:02Z","title":"Supervised Learning-enhanced Multi-Group Actor Critic for Live Stream Allocation in Feed"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 0 inbound Pith citation observations for arXiv:2412.10381."}