{"as_of":"2026-08-09T20:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9cded8a0d79a153f3878fa6e9d7ddb01a94db8f4b7afd8e41fe396dba4ee8d0f","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T15:45:06.723194Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.06358/citation-record","integrity":"/paper/2502.06358/integrity","json":"/paper/2502.06358/citation-record.json","paper":"/paper/2502.06358"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:45:06.644785Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.644785Z"},"links":{"citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:2fa8bca484813c7aa6858f7b6dbcddb2f80843b48dd7dc44a6f1eb76863f9b26","observation_id":"3af19425-ff16-49a3-8c6e-16da01b46442","resolution":{"observed_at":"2026-08-08T15:45:06.644785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:45:06.650434Z","title":"Advances in neural information processing systems 33, 1877–1901 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.650434Z"},"links":{"citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:0ab6c428c47c0f48fada8a590e972b60a61c4fa897ecd90c8c0159390314a636","observation_id":"55672e0d-51e7-4a6f-8e29-841db309bf0d","resolution":{"observed_at":"2026-08-08T15:45:06.650434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:45:06.990777Z","title":"In: Pro- ceedings of the 41st International Conference on Machine Learning","venue":null,"work_id":"4979d747-f815-4f88-8947-b0e28d9629a2","year":2024},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.654910Z"},"links":{"citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:9aaffbfbffb01a302163bccd2389a690bc87565911e10043d308905912440a8b","observation_id":"8c8d2db2-8ed6-49c3-b1e8-073838a400e9","resolution":{"observed_at":"2026-08-08T15:45:06.994954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:45:06.974557Z","title":"Advances in neural information processing systems 34, 15084–15097 (2021)","venue":null,"work_id":"654634a0-351d-4554-8a72-133f9a689fb0","year":2021},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.659373Z"},"links":{"citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:41ac4fc27f16d88646d821c8a482d8485beec4832d97d95922f5a5055955282e","observation_id":"0c285e4b-dbe2-4698-bed8-9bc5b2f3b782","resolution":{"observed_at":"2026-08-08T15:45:06.979175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-08T15:45:06.664094Z","title":"arXiv preprint arXiv:2010.11929 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.664094Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:d1f1a17940fecc99889071c1002c2b0175ffe4b9d4aed0c972372b326ea724d7","observation_id":"19de3897-f4e1-449d-a78b-5428816974d4","resolution":{"observed_at":"2026-08-08T15:45:06.664094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09648","last_updated":"2023-05-16T17:49:04Z","snapshot_observed_at":"2026-07-06T15:28:16.998343Z","submitted_at":"2023-05-16T17:49:04Z","title":"Prompt-Tuning Decision Transformer with Preference Ranking","version":1},"cited_work":{"arxiv_id":"2305.09648","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.09648","snapshot_observed_at":"2026-08-08T15:45:06.830496Z","title":"Prompt-Tuning Decision Transformer with Preference Ranking","venue":"cs.LG","work_id":"300375be-cd20-472f-bcf2-d1191016e950","year":2023},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.668750Z"},"links":{"cited_paper":"/paper/2305.09648","citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:2781768eae75ab45b072ff9caf633a9684ad973ccde5cc810903042fc08ab007","observation_id":"e45d8454-0b7a-4fda-9e05-1942449a1d68","resolution":{"observed_at":"2026-08-08T15:45:06.834664Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01168","last_updated":"2024-11-02T07:38:02Z","snapshot_observed_at":"2026-07-06T19:43:59.326124Z","submitted_at":"2024-11-02T07:38:02Z","title":"Prompt Tuning with Diffusion for Few-Shot Pre-trained Policy Generalization","version":1},"cited_work":{"arxiv_id":"2411.01168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.01168","snapshot_observed_at":"2026-08-08T15:45:06.811595Z","title":"Prompt Tuning with Diffusion for Few-Shot Pre-trained Policy Generalization","venue":"cs.LG","work_id":"5740d052-9438-4319-99a5-8d1ebb5dd4fd","year":2024},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.674466Z"},"links":{"cited_paper":"/paper/2411.01168","citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:6d6da1c820f0c6e30592542afeab404577e8d5a3a18e8e840231efb73c84f2c9","observation_id":"e539d1b3-3cea-4ede-9228-c61c018ebfd0","resolution":{"observed_at":"2026-08-08T15:45:06.817795Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-08T15:45:06.678382Z","title":"arXiv preprint arXiv:2104.08691 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.678382Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:9b9726d2417a73b858802e2e1344f9149c2a63e016eb5f0ebd1953ae572e5862","observation_id":"35363cb2-2fcb-4cff-ad02-40fea60c53d7","resolution":{"observed_at":"2026-08-08T15:45:06.678382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:45:06.959977Z","title":"In: Proceedings of the 19th international conference on World wide web","venue":null,"work_id":"7a487808-6ef6-45ba-a919-b6b27e2c9c47","year":2010},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.683175Z"},"links":{"citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:de75eccbae9b5a3dfd4a3f40f0590142a183944b71dce83697ff016c4f35ef75","observation_id":"0b32bd56-4a63-4e7a-8556-f8a6510cf7d8","resolution":{"observed_at":"2026-08-08T15:45:06.964480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.03044","last_updated":"2023-09-20T21:12:31Z","snapshot_observed_at":"2026-08-07T16:34:17.924513Z","submitted_at":"2023-01-08T14:04:26Z","title":"A Survey on Transformers in Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.03044","snapshot_observed_at":"2026-08-08T15:45:06.686947Z","title":"arXiv preprint arXiv:2301.03044 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.686947Z"},"links":{"cited_paper":"/paper/2301.03044","citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:32ce1429c3e6d1c9f5d794f5094c65dda84678b8b3c65fc9412b3c174dc3932a","observation_id":"69076c5d-e0ee-4c73-9c58-e81c39d8c0ab","resolution":{"observed_at":"2026-08-08T15:45:06.686947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:45:06.946968Z","title":"In: NeurIPS 2023 Workshop on Instruction Tuning and Instruction Following (2023)","venue":null,"work_id":"07868134-841c-4565-97b8-12ee1b0f1317","year":2023},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.690452Z"},"links":{"citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:b81ecc5c2f1d060e280ebc8c1e45b85c8e255584107cecc8b32777a5f345bc2c","observation_id":"7dd92499-d746-4615-b3e9-4e26817e8b6f","resolution":{"observed_at":"2026-08-08T15:45:06.951706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:45:06.693831Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.693831Z"},"links":{"citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:1c4b52d342e858e6d2175788b69deed9e0007ef2a273442b4ea936ca5fe1551e","observation_id":"28cc83a4-6f68-4916-bd93-760a4bc7f956","resolution":{"observed_at":"2026-08-08T15:45:06.693831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:45:06.926656Z","title":"In: International conference on machine learning","venue":null,"work_id":"e15cc811-ce47-46a2-94d8-931b3c5a83a4","year":2021},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.697527Z"},"links":{"citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:916141612ff4872d734867b54e51f2d90a5664f5aa1e6e3f71b9d23f4516ef14","observation_id":"9f7f0a08-8380-4313-91cf-64cb795bbaa6","resolution":{"observed_at":"2026-08-08T15:45:06.931576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:45:06.913591Z","title":"Transactions on Machine Learning Research","venue":null,"work_id":"3770e2b9-0111-4f07-b0bb-786c65ac7a06","year":null},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.700966Z"},"links":{"citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:b18927025e09206ad8b995524f57b8c27590563bab62f9427028c48f0a8c6b22","observation_id":"973e510e-2489-47bc-a3e2-9e55f2b6491a","resolution":{"observed_at":"2026-08-08T15:45:06.917946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-08T15:45:06.704519Z","title":"arXiv preprint arXiv:1707.06347 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.704519Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:1b20f10fdf999d88403e5c65078b1b9dc060cd6f26ebaac674cd767390b8884b","observation_id":"729f4359-cd15-462c-a47f-ef6f3244ff5c","resolution":{"observed_at":"2026-08-08T15:45:06.704519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:45:06.901184Z","title":null,"venue":null,"work_id":"b072285e-5e1d-4bd6-a69a-080f774e7c9b","year":2024},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.708198Z"},"links":{"citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:2f100cfdc015fa3733a74aea07e190e5618c6128c553d6f9f27db2aa98a19dc0","observation_id":"34609c7c-b00a-4ba9-8270-16502d9aa66e","resolution":{"observed_at":"2026-08-08T15:45:06.905417Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03751","last_updated":"2024-04-13T09:38:13Z","snapshot_observed_at":"2026-08-04T21:51:34.061009Z","submitted_at":"2023-03-07T09:20:43Z","title":"Zeroth-Order Optimization Meets Human Feedback: Provable Learning via Ranking Oracles","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03751","snapshot_observed_at":"2026-08-08T15:45:06.712104Z","title":"arXiv preprint arXiv:2303.03751 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.712104Z"},"links":{"cited_paper":"/paper/2303.03751","citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:1418be152e97afcf5b03592307b7db42086ca8e5c8a67a39782685a26120e2f1","observation_id":"6e240516-5ea6-4089-99c3-efbd86510ea0","resolution":{"observed_at":"2026-08-08T15:45:06.712104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:45:06.887118Z","title":null,"venue":null,"work_id":"56d0b5a6-5c23-4e3f-b5f6-a7cccb2cbbf5","year":1933},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.716250Z"},"links":{"citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:0029d4174f8f16e436eb4b80e0d0eb1f2b7c7f5fbe8bda1b3670299c5a56eeca","observation_id":"280d3f35-198c-4247-9d39-a00913607638","resolution":{"observed_at":"2026-08-08T15:45:06.891997Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:45:06.871210Z","title":"In: in- ternational conference on machine learning","venue":null,"work_id":"d3bd4e7a-48a6-47b1-b8d4-a64d60881656","year":2022},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.719612Z"},"links":{"citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:b8f5211d9ffaa62408bf72fb10826aa28c0e516832bca59476d0a1dda134a3ad","observation_id":"bab4f885-62de-4eb7-b423-6b28d0a3b359","resolution":{"observed_at":"2026-08-08T15:45:06.876398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T15:45:06.854425Z","title":"Advances in Neural Information Processing Systems37, 55086–55114 (2024)","venue":null,"work_id":"f5f596f1-818a-4bea-a542-d22dc9415845","year":2024},"citing_paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T15:45:06.723194Z"},"links":{"citing_paper":"/paper/2502.06358"},"observation_digest":"sha256:cddbe7a6a98ffd64bbe1fba98e82c8ff9b1e4d428c2fe3f49161865434d4d8a8","observation_id":"1b76e480-d7d0-40f2-8ac7-e843370c5502","resolution":{"observed_at":"2026-08-08T15:45:06.858870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.06358","last_updated":"2025-07-18T08:29:35Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T15:39:39.366927Z","submitted_at":"2025-02-10T11:20:10Z","title":"Prompt-Tuning Bandits: Enabling Few-Shot Generalization for Efficient Multi-Task Offline RL"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2502.06358."}