{"as_of":"2026-08-18T06:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5458d80d603b94092a8d5a1459e3b167b4b6721ed6e8fc690f9f9ee507ea74d3","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:59:41.281514Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.11221/citation-record","integrity":"/paper/2505.11221/integrity","json":"/paper/2505.11221/citation-record.json","paper":"/paper/2505.11221"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.016760Z","title":"Mastering the game of go with deep neural networks and tree search,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.016760Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:7d9eb970d7d6459d98c915f89d9fd9f832bd52cbbf923eaa91a63d46846458f1","observation_id":"12b45feb-cf55-4525-be8a-32e6644f08ae","resolution":{"observed_at":"2026-08-15T20:59:41.016760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.192068Z","title":"Advanced planning for autonomous vehicles using reinforcement learning and deep inverse reinforcement learning,","venue":null,"work_id":"976f5c35-a85a-4eec-8a53-fc0d1d8b7725","year":2019},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.022428Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:85f53af319980dffc6dd104f7260a2fed8669d4eb44db5bda63165dbe26df8b2","observation_id":"374f6784-dfc4-457b-873e-63da11c83dc0","resolution":{"observed_at":"2026-08-15T20:59:42.197622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.174774Z","title":"Qt-opt: Scalable deep reinforcement learning for vision-based robotic manipu- lation,","venue":null,"work_id":"4bffb7bf-68ff-4689-955f-7df88abedb7f","year":2018},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.027555Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:8c6c4bea9e89392ae90550782697db7c63e063186e8a43ea4b4bfcea73f4e2ce","observation_id":"2ada002b-50ab-4b48-999c-61eff2ab90db","resolution":{"observed_at":"2026-08-15T20:59:42.180669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.154603Z","title":"Mastering atari, go, chess and shogi by planning with a learned model,","venue":null,"work_id":"8be52c06-1f8a-4554-b349-8359a453e2c8","year":2020},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.033210Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:8c8b76a36cd0419d77a7e891c9bf7730ad6f95732edc21dabda5812d35c868f0","observation_id":"88899db3-57af-4c87-973e-c91341cb9213","resolution":{"observed_at":"2026-08-15T20:59:42.161273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.131486Z","title":"Hindsight goal ranking on replay buffer for sparse reward environment,","venue":null,"work_id":"c31c9ba6-04b2-4a3a-a30b-850fb281b1aa","year":2021},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.038495Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:ef618949d63ca3dbf1f562a97764ec4e9066ff99dc311f1e7883e63b4f0a31a9","observation_id":"e761d655-2eb4-46a3-b0a8-a6924722d97d","resolution":{"observed_at":"2026-08-15T20:59:42.138548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.108814Z","title":"Utilizing skipped frames in action repeats for improving sample efficiency in reinforcement learning,","venue":null,"work_id":"9a50828e-e43f-4cd5-897d-4276d313527e","year":2022},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.044058Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:ecb596cbd6f50320a0ac69545845b5970d61ffa070d6a05359aba87619758353","observation_id":"cacf23d0-8b6d-43f3-afdb-3bcaa311684c","resolution":{"observed_at":"2026-08-15T20:59:42.116098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.090152Z","title":"Predictive coding for decision transformer,","venue":null,"work_id":"8f3535c5-98ef-4445-8fd9-f6d68d9209f6","year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.050425Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:5f265f7572a0aefb28001b70a44585ba00819e932114474225af770792503d93","observation_id":"23b1ea9c-e676-46a9-9cc5-63fada2bb3e8","resolution":{"observed_at":"2026-08-15T20:59:42.096012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06680","last_updated":"2019-12-13T19:56:40Z","snapshot_observed_at":"2026-08-13T14:13:07.807518Z","submitted_at":"2019-12-13T19:56:40Z","title":"Dota 2 with Large Scale Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06680","snapshot_observed_at":"2026-08-15T20:59:41.056303Z","title":"Dota 2 with large scale deep reinforcement learning,","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.056303Z"},"links":{"cited_paper":"/paper/1912.06680","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:6146749d84064c638673bfef59c7ac1814812aa7e9e2214d22894962ded475ab","observation_id":"6a11b1b3-ac27-41a0-9bfa-2f64ad4911f9","resolution":{"observed_at":"2026-08-15T20:59:41.056303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.071922Z","title":"A comprehensive survey on safe reinforce- ment learning,","venue":null,"work_id":"02e4d088-9016-433c-ac83-15a8de5264a1","year":2015},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.061637Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:7bb03cc1d8e1bb784861668965bb8ecba7f5fb5cb1568a3285aaaba2bf92b523","observation_id":"e12c152e-d9b1-43e1-abd5-c26168028409","resolution":{"observed_at":"2026-08-15T20:59:42.078854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.054539Z","title":"No falls, no resets: Reliable humanoid behavior in the darpa robotics challenge,","venue":null,"work_id":"2bcf5b5e-ca9a-4ba5-9ad2-acb2ca6af1c9","year":2015},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.067101Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:721207dd12240233c387217ce900760f3cd13942364fddf406d371ecf56d1a33","observation_id":"21454ae8-9264-4d55-b328-08ade17e5816","resolution":{"observed_at":"2026-08-15T20:59:42.060001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.034741Z","title":"Deep reinforcement learning: A brief survey,","venue":null,"work_id":"53ea38d0-0930-4602-b3dd-5c919114e1b0","year":2017},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.071821Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:9ef9fdbfbde6b74062a4bf3bdcdb63e4e4a62d074fe79ab21315bee8b6b7bcfe","observation_id":"2819d1b1-c94e-4d10-aebe-a8f57790659b","resolution":{"observed_at":"2026-08-15T20:59:42.040985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.076975Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.076975Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:a8ac33d10009a5ef55ed93748a7c490cf189cd598f20efafa70ac56e1622c039","observation_id":"004f6a71-28d9-429f-8bff-8b3771b7e502","resolution":{"observed_at":"2026-08-15T20:59:41.076975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-15T20:59:41.082178Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.082178Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:c26cf854689609f6730e36cea6db47c0cd15c99341fc5bd704d1bc1104bb41ab","observation_id":"1a12b399-4e20-4909-9477-33ca8df11950","resolution":{"observed_at":"2026-08-15T20:59:41.082178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-15T20:59:41.087154Z","title":"On the opportunities and risks of foundation models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.087154Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:4aaf7aaf8d342e9d7b920ae36b2642e4828a4b4454b2a72ffff2450bdee24a7c","observation_id":"3b9b039e-4a3d-4c01-98fe-c08c0e227e66","resolution":{"observed_at":"2026-08-15T20:59:41.087154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-15T20:59:41.091688Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.091688Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:5ac152b4e4fb70eb38eff404de8e60961f00056f18abeedfc31f4ccfd7830cd7","observation_id":"309e9cdc-7ec7-45f7-8d12-f298c6c72fd6","resolution":{"observed_at":"2026-08-15T20:59:41.091688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:42.003307Z","title":"Openai. gpt-4v,","venue":null,"work_id":"9198adae-373b-40de-a09f-f15b411c4b3c","year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.097123Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:4648a1072b85b1323dec73566a8f1a55e1d30c6def39c86ef00a6d41f4af600e","observation_id":"e853ad67-0be1-4149-8690-34eeb5e2efdc","resolution":{"observed_at":"2026-08-15T20:59:42.009167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-15T20:59:41.101775Z","title":"Do as i can, not as i say: Grounding language in robotic affordances,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.101775Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:dfb105947aa4b041f9fb31c73f31addf367a7a292b969e4ea455f71badec38c8","observation_id":"73121656-f8a6-48f4-94f6-cee085346f26","resolution":{"observed_at":"2026-08-15T20:59:41.101775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.983781Z","title":"Language models as zero-shot planners: Extracting actionable knowledge for embodied agents,","venue":null,"work_id":"55714f79-26a6-4ec8-a596-ea416223bf82","year":2022},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.106538Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:22af8222beed4f940d60ffccda2f6e05043a663c629b1c42f0a363fe26e5fb86","observation_id":"0887c92a-18f5-4763-9aa5-0fb8b905530d","resolution":{"observed_at":"2026-08-15T20:59:41.989419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.966239Z","title":"Large language models as generalizable policies for embodied tasks,","venue":null,"work_id":"5f5f8b12-8635-4afd-8c8a-b19ece65fe76","year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.111452Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:374f92b15e4f2a66b0fa974d67134dbc81f509330236fe532833871c476a1a5f","observation_id":"fcbea04e-e131-4401-9fec-3787d0fbcbee","resolution":{"observed_at":"2026-08-15T20:59:41.972020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10292","last_updated":"2024-10-07T19:13:47Z","snapshot_observed_at":"2026-08-16T13:52:04.740660Z","submitted_at":"2024-05-16T17:50:19Z","title":"Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10292","snapshot_observed_at":"2026-08-15T20:59:41.116130Z","title":"Fine-tuning large vision-language models as decision-making agents via reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.116130Z"},"links":{"cited_paper":"/paper/2405.10292","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:33ccfb4ca72ec8d25ad468a425777c5646b104c12b1e581d48d6e53e515245a1","observation_id":"e1b7d85e-be24-4f27-acb9-2c7dc0e7d20f","resolution":{"observed_at":"2026-08-15T20:59:41.116130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-15T20:59:41.122020Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.122020Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:399574592ff60aefb59d40d16596acb5328498be24ff6058ea5b32eee1639e44","observation_id":"399ad55a-72b2-4784-9348-0ab362b99e56","resolution":{"observed_at":"2026-08-15T20:59:41.122020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.948647Z","title":"Palm: Scaling language modeling with pathways,","venue":null,"work_id":"bbfd38e6-2ec8-42d3-af0d-67e9039844f0","year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.126397Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:64dee5de0f450b40a75072b6b23f6afb4765200cb0a9ed8c96b4d51f0cf0bb56","observation_id":"72b92636-9d51-4181-8bd3-1892a3bd2cb7","resolution":{"observed_at":"2026-08-15T20:59:41.954129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-08-16T18:00:58.008096Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-15T20:59:41.131638Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.131638Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:c1c955fd60d9d24d9ae808dc4a6a7bd47a5aac680cfe1defdb3c847cdb0e20d3","observation_id":"98407cff-95d8-42a0-8cb6-470690c23c8a","resolution":{"observed_at":"2026-08-15T20:59:41.131638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T20:59:41.136847Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.136847Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:9c4d6192bc0207607389b132121686c0511f0ce0f0b92c4af76c1cf40185035c","observation_id":"304c07cf-6812-4672-98ba-78a28767842e","resolution":{"observed_at":"2026-08-15T20:59:41.136847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.931161Z","title":"Asynchronous methods for deep reinforcement learning,","venue":null,"work_id":"6c136d35-9da0-4322-a8d7-0a1fe8f3cc23","year":2016},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.141241Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:43b81c53f3680369cb573a5a603e924583554cfb74cb6618a5263ffcc3d05292","observation_id":"9375b1ad-ebf4-4abd-8857-850b3cbece2d","resolution":{"observed_at":"2026-08-15T20:59:41.936201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.914509Z","title":"Guiding pretraining in reinforcement learning with large language models,","venue":null,"work_id":"3fa86f4a-5a9a-4aae-9639-7581f7c5b2e2","year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.147213Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:dd42832f381de307e976ed87af3171482bbba484ebf380573539e96d8b5fc110","observation_id":"7ae865fb-960e-4774-9e16-aa28089e8908","resolution":{"observed_at":"2026-08-15T20:59:41.919926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.152352Z","title":"Progprompt: Generating situated robot task plans using large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.152352Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:5560d88e5064a837fb5bb9e3c4cd645efe827985ce606acae668112f93b516dc","observation_id":"cb90abaf-fed4-450d-a731-507c58d1852f","resolution":{"observed_at":"2026-08-15T20:59:41.152352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-17T09:42:08.942018Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-15T20:59:41.157203Z","title":"Inner mono- logue: Embodied reasoning through planning with language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.157203Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:70c03fb8b1dbe9427e05e303896b5233d8a94b785ad9467bfd18650fe0cb78cb","observation_id":"921fad93-7cc5-4c14-8671-f21cf653fcb2","resolution":{"observed_at":"2026-08-15T20:59:41.157203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.885929Z","title":"Enabling intelligent interactions between an agent and an llm: A reinforcement learning approach,","venue":null,"work_id":"a160c479-aa90-41ec-808d-66e242ec4b5d","year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.162015Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:3b26958389d988ff57d3c6029b7cf0aad10b54405ab861d3f3eae4390dbd3526","observation_id":"ba6aa2d7-a84e-4c0f-88e2-76eb8fa93d00","resolution":{"observed_at":"2026-08-15T20:59:41.892063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.868512Z","title":"Grounding large language models in interactive environments with online reinforcement learning,","venue":null,"work_id":"86e6978b-1187-4c33-90dd-57c47413fa0b","year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.167776Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:3ee3f8fa8d244e8de5f1f0eb2b8d88398bb41f89ca5bb9ea755f87bf78ac3e7b","observation_id":"90e9c8ea-ab1c-4d35-9c1c-09e51f68285c","resolution":{"observed_at":"2026-08-15T20:59:41.874356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.850690Z","title":"Introducing gemini: our largest and most capable ai model,","venue":null,"work_id":"623ad8cb-fec3-4670-af0d-0aa33fd9652e","year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.173907Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:899f589e017dc1ec930b82f72bef610695d99b992b640863ecaa1ab926ee7a04","observation_id":"627dc17b-390e-4f3b-9360-b7d22f48d547","resolution":{"observed_at":"2026-08-15T20:59:41.856431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-15T20:59:41.179132Z","title":"Qwen2. 5 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.179132Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:64f27e327d57c15324107c344dd0e7642f87b6b4e30f7f60c6d9a87cf8c9b6a0","observation_id":"dfcedf34-5a29-42cc-844b-085a800a7dfd","resolution":{"observed_at":"2026-08-15T20:59:41.179132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.184370Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.184370Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:c8d438f442c13618a01f204ace6699aac0f325639ce599ebf64b43c46ec0d280","observation_id":"8db894f0-eb4a-4bec-93d9-24ca9e2e60c6","resolution":{"observed_at":"2026-08-15T20:59:41.184370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01534","last_updated":"2024-05-02T17:59:31Z","snapshot_observed_at":"2026-08-17T04:38:59.677031Z","submitted_at":"2024-05-02T17:59:31Z","title":"Plan-Seq-Learn: Language Model Guided RL for Solving Long Horizon Robotics Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01534","snapshot_observed_at":"2026-08-15T20:59:41.189783Z","title":"Plan-seq- learn: Language model guided rl for solving long horizon robotics tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.189783Z"},"links":{"cited_paper":"/paper/2405.01534","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:385318ba33fd3e522d7c061cab640d870d7534c88411bc643fc7422f5a76ca4f","observation_id":"c5d046f5-9430-464c-a32b-38894c703de5","resolution":{"observed_at":"2026-08-15T20:59:41.189783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-18T00:13:27.570520Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-15T20:59:41.196985Z","title":"Reward design with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.196985Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:44d5fa80457983577eefdf8f9f0329954e7b55850844b379e29772e627fcce14","observation_id":"f9347ac1-3a04-4b37-87f8-a2a89600d53f","resolution":{"observed_at":"2026-08-15T20:59:41.196985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12921","last_updated":"2024-03-14T12:16:00Z","snapshot_observed_at":"2026-08-16T14:50:37.995504Z","submitted_at":"2023-10-19T17:17:06Z","title":"Vision-Language Models are Zero-Shot Reward Models for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12921","snapshot_observed_at":"2026-08-15T20:59:41.202600Z","title":"Vision-language models are zero-shot reward models for reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.202600Z"},"links":{"cited_paper":"/paper/2310.12921","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:3fc043037fb1d5ab53111a9c488d22d5067668f2d40cf2663853428e6b69da62","observation_id":"4541a172-4582-4d2f-91c1-6f0dc5d04da7","resolution":{"observed_at":"2026-08-15T20:59:41.202600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-16T14:21:09.886387Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-15T20:59:41.208656Z","title":"Rl-vlm-f: Reinforcement learning from vision language foundation model feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.208656Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:3b05410d8273eaa5a91ef33f80914b76e72ec228ed9358eb94f1f6d0bda073cc","observation_id":"d6e0d8eb-dcc5-43a1-8cd8-7c1850be8884","resolution":{"observed_at":"2026-08-15T20:59:41.208656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-08-13T16:55:46.498156Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-15T20:59:41.214510Z","title":"V oyager: An open-ended embodied agent with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.214510Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:7fb6d9399afd6f76be2a1b3a5a9d950eb5e2e5168a2a60a43f32f133a8588414","observation_id":"79cb93c5-bbab-4fc9-a2e6-0b13b27de1a8","resolution":{"observed_at":"2026-08-15T20:59:41.214510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10021","last_updated":"2023-10-17T12:01:17Z","snapshot_observed_at":"2026-08-16T14:51:56.213095Z","submitted_at":"2023-10-16T02:43:47Z","title":"Bootstrap Your Own Skills: Learning to Solve New Tasks with Large Language Model Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10021","snapshot_observed_at":"2026-08-15T20:59:41.221259Z","title":"Bootstrap your own skills: Learning to solve new tasks with large language model guidance,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.221259Z"},"links":{"cited_paper":"/paper/2310.10021","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:ddbf0607ec1f600e6288bda80a806e90a84be3ce523be2b8d8163ed9df92a5ac","observation_id":"aa1c2f58-d289-44cb-b677-69551e889f3e","resolution":{"observed_at":"2026-08-15T20:59:41.221259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.821583Z","title":"Embodiedgpt: Vision-language pre-training via embodied chain of thought,","venue":null,"work_id":"4abb8101-9f4a-4810-83d1-23d86e816a25","year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.226802Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:77d7030e56971e71767e05ae6be2cd7cdc3a2f5c2807a574fcc170deac583cb8","observation_id":"8bdc0382-62f0-44ac-9437-0d12274b4263","resolution":{"observed_at":"2026-08-15T20:59:41.826830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02651","last_updated":"2024-05-23T01:04:11Z","snapshot_observed_at":"2026-08-17T17:09:20.296385Z","submitted_at":"2024-02-05T00:48:56Z","title":"Vision-Language Models Provide Promptable Representations for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02651","snapshot_observed_at":"2026-08-15T20:59:41.232110Z","title":"Vision-language mod- els provide promptable representations for reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.232110Z"},"links":{"cited_paper":"/paper/2402.02651","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:8ce7cd0187af8f797bef5f2cf44605e14761a43b4f45683661e685d42bbe9c34","observation_id":"0c388fba-6c6c-49d7-862e-aad30cc1e6e5","resolution":{"observed_at":"2026-08-15T20:59:41.232110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.805022Z","title":"Policy distillation,","venue":null,"work_id":"784e5a8e-c9d0-4596-bb9d-adfd06212f84","year":2015},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.237652Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:d3684e5e22aad0a3fded374ae3075adfbe6c79583b5cdf655b9e8a53c1396e0c","observation_id":"86f2b24e-5c2f-49cb-a5e0-0fa78e362dbe","resolution":{"observed_at":"2026-08-15T20:59:41.810268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06342","last_updated":"2016-02-22T19:59:40Z","snapshot_observed_at":"2026-08-14T22:22:09.818117Z","submitted_at":"2015-11-19T20:17:27Z","title":"Actor-Mimic: Deep Multitask and Transfer Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06342","snapshot_observed_at":"2026-08-15T20:59:41.244006Z","title":"Actor-mimic: Deep multitask and transfer reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.244006Z"},"links":{"cited_paper":"/paper/1511.06342","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:48cfe739aafbe1d7a13439e4da1f599e0818d4324040be30389536c1a9ea291e","observation_id":"ff176453-e3da-4a72-8bc3-f890816a73d3","resolution":{"observed_at":"2026-08-15T20:59:41.244006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.778621Z","title":"Guided policy search,","venue":null,"work_id":"631121f9-45bf-446b-9afd-3ae369e01ff5","year":2013},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.249797Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:03b16a076a32d2a1c77519dabe5863c6c962cefc913981d857502bfe42311441","observation_id":"ae662865-6a6f-42fe-b1ad-6f57d153b6d1","resolution":{"observed_at":"2026-08-15T20:59:41.793015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.758248Z","title":"Neural network dynamics for model-based deep reinforcement learning with model-free fine-tuning,","venue":null,"work_id":"3c076cd9-6063-45d0-a23e-be71d4680986","year":2018},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.255806Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:0a49b051bf1d05e8193ac3d42a558489bc6c60a20044f6e5b8204136d5a03075","observation_id":"44c0d836-a331-474c-9338-6de3c43ae6bb","resolution":{"observed_at":"2026-08-15T20:59:41.764856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.737952Z","title":"Agents teaching agents: a survey on inter-agent transfer learning,","venue":null,"work_id":"b89a5178-6503-4950-aee2-3208177349d5","year":2020},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.260660Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:cda006e74f1bf608825f44a7192d96a99f5e7ebffe0eac735b1c44020d1065c2","observation_id":"497f7ed1-13c2-4fea-a19c-dea6c2b02efc","resolution":{"observed_at":"2026-08-15T20:59:41.746078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.719739Z","title":"Reincarnating reinforcement learning: Reusing prior computation to accelerate progress,","venue":null,"work_id":"cf4a3274-3b39-41df-8647-3fdea14cdaea","year":2022},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.265404Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:96e691a088ce57a6f3a7990820417daca329d466a149cebcfab1b3a2601982bd","observation_id":"9424baa2-0bc3-4fa1-b8f1-3a8f7965de6d","resolution":{"observed_at":"2026-08-15T20:59:41.725844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03835","last_updated":"2018-03-10T16:45:00Z","snapshot_observed_at":"2026-08-14T19:37:32.915923Z","submitted_at":"2018-03-10T16:45:00Z","title":"Kickstarting Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03835","snapshot_observed_at":"2026-08-15T20:59:41.270545Z","title":"Kickstarting deep reinforcement learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.270545Z"},"links":{"cited_paper":"/paper/1803.03835","citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:5f1da7486303cbbe6543fea7c8e6f93a4ac43c517fb10da012525d200cf6061c","observation_id":"7e66c295-55df-46b2-a47f-c04b0a8c8b1d","resolution":{"observed_at":"2026-08-15T20:59:41.270545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.701722Z","title":"When does label smoothing help?","venue":null,"work_id":"0aa8a46b-dbae-45f8-a716-5e76755744c5","year":2019},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.276607Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:e305985c3f304456b74159c02461656eaaf7e25e88d8fa14c1225d6bf3a550a1","observation_id":"7ee6f8c5-bf57-4e97-bcb9-0211e6784704","resolution":{"observed_at":"2026-08-15T20:59:41.707149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:59:41.681398Z","title":"Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal- oriented tasks,","venue":null,"work_id":"87ee3f1f-d0c7-4335-b982-53e8851c0446","year":2024},"citing_paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T20:59:41.281514Z"},"links":{"citing_paper":"/paper/2505.11221"},"observation_digest":"sha256:94d8f703e8d4b30854b68ba3d8b4917f9691786499f1fbc89f7d6d327d85cc43","observation_id":"1a679df0-1267-4705-a418-1b30313f31c6","resolution":{"observed_at":"2026-08-15T20:59:41.688286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.11221","last_updated":"2025-05-16T13:15:54Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T17:09:56.736853Z","submitted_at":"2025-05-16T13:15:54Z","title":"Sample Efficient Reinforcement Learning via Large Vision Language Model Distillation"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2505.11221."}