{"as_of":"2026-08-10T04:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b0d4931aa3743686ebc5735be270d4fd1b84835c91a022354f3c3a19f33bd029","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:12:39.980717Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T14:07:10.387869Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T14:10:13.290156Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.19769","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19769","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tevir: Text-to-video reward with diffusion models for efficient reinforcement learning","venue":null,"work_id":"9ba6d520-d9d6-4128-af72-cdef0acf0a50","year":2025},"citing_paper":{"arxiv_id":"2602.10503","last_updated":"2026-05-16T03:35:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-11T04:05:03Z","title":"Towards Long-Lived Robots: Continual Learning VLA Models via Reinforcement Fine-Tuning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T14:07:10.387869Z"},"links":{"cited_paper":"/paper/2505.19769","citing_paper":"/paper/2602.10503"},"observation_digest":"sha256:291531819120d81ab31604fe8587c1455a530e674b5d3ff8f77ef8591223aa85","observation_id":"8c6c6ecb-c957-4102-8fde-ac21f52f0c8e","resolution":{"observed_at":"2026-05-21T14:10:13.292099Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19769/citation-record","integrity":"/paper/2505.19769/integrity","json":"/paper/2505.19769/citation-record.json","paper":"/paper/2505.19769"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:48.888109Z","title":"Reinforcement learning control of a flexible two-link manipulator: An experimental investiga- tion,","venue":null,"work_id":"1fbe3f0d-7f9f-4229-8e05-6e355cc1f832","year":2021},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.075020Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:3c72b7dea01aa71aa3739126d6bddd131f7ade56a5bfe0e10b46f5895487bb5f","observation_id":"27024c23-bf04-4f95-940f-23bed71c8ed5","resolution":{"observed_at":"2026-08-07T14:12:48.980192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:48.745334Z","title":"A hierarchical deep reinforcement learning framework for 6-dof ucav air-to-air combat,","venue":null,"work_id":"fc25b1f1-05b7-436c-bd32-d5f2baf96d27","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.140710Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:79cbad136d89458c4be318646705990717780ee7bcfc899f6db0c9b780da5ef8","observation_id":"1abc96b1-5307-4a78-b372-3c4875891862","resolution":{"observed_at":"2026-08-07T14:12:48.786602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:48.589802Z","title":"Conrft: A reinforced fine-tuning method for vla models via consistency policy,","venue":null,"work_id":"ee6c8c73-41d8-43b6-87f9-bf4d7e6bcc73","year":2025},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.212152Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:80c99e5d3e20132cabfb5e34e31095032d7e1997bd0ebdb728e275b3f6d5ae3d","observation_id":"225c0f0c-5c41-4fbc-9909-df8e35703d79","resolution":{"observed_at":"2026-08-07T14:12:48.668624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:48.391015Z","title":"End-to-end robotic rein- forcement learning without reward engineering,","venue":null,"work_id":"b44a5527-c9b2-4d0d-94f3-fd38562b70f0","year":2019},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.286207Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:5e5a23d317d2adb2dd43d5157fba063fda934db1c980aa7c8685a1106541bfc6","observation_id":"14bdcf12-d5af-4640-95fb-450e6caad0a4","resolution":{"observed_at":"2026-08-07T14:12:48.464203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:48.183603Z","title":"Deep learning in robotics: Survey on model structures and training strategies,","venue":null,"work_id":"286e2f84-f443-4941-89c5-6b807c3195b7","year":2021},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.381085Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:ee6397acfb6f95c23af34aa0b538aca38609ddc2be8376f53fe27d6707a4ba81","observation_id":"8eee8e24-f7e1-4009-b36e-a37673c1e7d2","resolution":{"observed_at":"2026-08-07T14:12:48.293567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:48.039145Z","title":"Deep reinforcement learning-based automatic exploration for navigation in unknown environment,","venue":null,"work_id":"97669c8e-2c09-4dbe-959e-d5ccf6783ada","year":2020},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.453689Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:7a7ce7e92bea1ed7a8fcaec4227676360962c4dda61f5ece9f29151c29083255","observation_id":"c56853e9-357e-4fdb-9f96-d96174c16464","resolution":{"observed_at":"2026-08-07T14:12:48.109248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:47.837542Z","title":"Reward design with language models,","venue":null,"work_id":"3bafee3a-1536-4269-839b-038a108bc1c1","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.556922Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:3e6b1fe9f5e9d9a3f42d9c8ff75fdeae306b5feb6e48080d9deb648fe9b2de34","observation_id":"d46f445b-e656-431f-adc1-abe139950ee4","resolution":{"observed_at":"2026-08-07T14:12:47.912083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:47.685820Z","title":"A survey of inverse reinforcement learning: Challenges, methods and progress,","venue":null,"work_id":"c4bfd3ea-4456-4a3a-a535-f28148c9ddd0","year":2021},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.638152Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:16d9a8783c9ccf9bd068b3774887f62fcd26d89292874f587672c286a1b333cf","observation_id":"b501e6ce-83e3-458f-9aa3-add038e931a7","resolution":{"observed_at":"2026-08-07T14:12:47.760505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-07T14:12:36.725785Z","title":"Concrete problems in ai safety,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.725785Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:0ef9c18735678bf8ffd2ffa624dc877f05087b267783ad9015be0e4c11796197","observation_id":"7da671b2-4475-4e32-99d6-66747769b72d","resolution":{"observed_at":"2026-08-07T14:12:36.725785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:49.038904Z","title":"VIP: towards universal visual reward and representation via value-implicit pre-training,","venue":null,"work_id":"72bebd9f-f20b-4cf8-b789-5e24b88c5f8c","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.788123Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:02120fcf9adfa1209454c229bf4f39f220876116e0d74178418ce47cdb19d406","observation_id":"c3cbd773-c63e-4274-929f-098bf17c90eb","resolution":{"observed_at":"2026-08-07T14:12:49.073408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:47.249471Z","title":"Robot fine-tuning made easy: Pre-training rewards and policies for autonomous real-world reinforcement learning,","venue":null,"work_id":"1fc0ea2b-7e44-467a-9383-8796f7118efb","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:36.977314Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:abc18cf740ab3864c369f0fc309fbe679103c5eef7aa116d924bdd702e4bddd7","observation_id":"825f694e-f6b6-4ed6-9990-55202c3d94f6","resolution":{"observed_at":"2026-08-07T14:12:47.356268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:47.064743Z","title":"Roboclip: One demonstration is enough to learn robot policies,","venue":null,"work_id":"8bfda589-8ce4-4e53-ae38-28f906c524ee","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.075374Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:21f4b434d89fd4dbdc90e292460733f5a4b2ceee042f3e9cb31453fd66cf1e5e","observation_id":"596ccf72-8360-4465-a1e6-5a2919135b43","resolution":{"observed_at":"2026-08-07T14:12:47.158266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:46.911430Z","title":"RL-VLM-F: reinforcement learning from vision language foundation model feedback,","venue":null,"work_id":"a00b58dc-3297-4afd-9b29-12cc67c7ebc2","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.154300Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:743086012f1d00f6ed5a00c0a8a23238550215f1f4763707b9d53f8d6f9c0f1c","observation_id":"76f78089-5877-4bfa-9fb6-a977c136a0d6","resolution":{"observed_at":"2026-08-07T14:12:46.963585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:37.242406Z","title":"Video diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.242406Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:da0b87cb5051db6f670b02ac7dd0dc8ec26a1cc13b292ae295fa2fdceabb0b74","observation_id":"e7b7cd0a-ab1a-42a6-943f-d3d1263da7e7","resolution":{"observed_at":"2026-08-07T14:12:37.242406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-07T14:12:37.325571Z","title":"Imagen video: High definition video generation with diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.325571Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:a95a402935e82c1e932de351dced8841affcf1d8fdc44c4063383f5e4787cd77","observation_id":"cb591e85-a4c9-451c-bdfe-29f39d0749d3","resolution":{"observed_at":"2026-08-07T14:12:37.325571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:46.750292Z","title":"Learning universal policies via text-guided video generation,","venue":null,"work_id":"263662a2-de1a-4374-b19d-7f210b2cad44","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.372947Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:df201a17f04ddb804aef34f1d3868d8bd7f0348fbd3642752e939acc2b38f3c9","observation_id":"f5b35545-33cc-4a89-a8ef-6156b2b944a0","resolution":{"observed_at":"2026-08-07T14:12:46.835479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:46.558244Z","title":"Learning to act from actionless videos through dense correspondences,","venue":null,"work_id":"d4ea0317-86a2-49ad-b949-348db7532b02","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.415391Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:4100c7ac0146fb85b765293eda40fc6ee5fd6f90c6b9f71eafa64d925b0c1e2a","observation_id":"34755670-cc72-4d5b-96d0-f8eeb95c7bf3","resolution":{"observed_at":"2026-08-07T14:12:46.646711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:46.361960Z","title":"Learning interactive real-world simu- lators,","venue":null,"work_id":"8e8a95cc-ab7b-48e0-9ea6-98e61133dede","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.493384Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:374f752ff371b03a4bd5321af27c67e3c2454f2c5127678aec2e28e43d82479a","observation_id":"30648508-4028-4a03-b905-5a8c9fae517c","resolution":{"observed_at":"2026-08-07T14:12:46.467102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:46.193299Z","title":"Any-point trajectory modeling for policy learning,","venue":null,"work_id":"1dde6a43-4757-4003-9aef-b173f8045994","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.557884Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:f2a112cfa0fd0812c3cfbe59e3f8f46b420bfccafca9f7ba564387d27973d4d8","observation_id":"3a26a60b-4bf6-4682-a7ff-9bfef229619d","resolution":{"observed_at":"2026-08-07T14:12:46.275066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02635","last_updated":"2026-04-23T15:06:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-04T07:56:42Z","title":"Reinforcement Learning with Foundation Priors: Let the Embodied Agent Efficiently Learn on Its Own","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02635","snapshot_observed_at":"2026-08-07T14:12:37.630387Z","title":"Foundation reinforcement learning: towards embodied generalist agents with foundation prior assistance,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.630387Z"},"links":{"cited_paper":"/paper/2310.02635","citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:caf45e8bc3ddd12e7649f37e24bfffa6f2ff65da5198c7b819c3a768f3a16ea1","observation_id":"e1c6dba3-f10f-4dc2-897a-232876ce1fe9","resolution":{"observed_at":"2026-08-07T14:12:37.630387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:45.981053Z","title":"Video prediction models as rewards for reinforcement learning,","venue":null,"work_id":"7bcf87ae-38a8-46e7-9521-77fc41f701c0","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.705385Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:b403044c6b37a02a7ed15442a5d6f8fc70cb38a451c38cb100dca555a6fa91d4","observation_id":"3354cdda-7796-4340-a7eb-7ce23412e17a","resolution":{"observed_at":"2026-08-07T14:12:46.086688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:45.777782Z","title":"Diffusion reward: Learning rewards via conditional video diffusion,","venue":null,"work_id":"7bf273fc-dd9c-4da5-b2c3-9bf010f74c12","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.785627Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:2f9a6f7a29fd2a9b32a29914f4b9e1fe53db3a2080bee407a313d59c83f8de82","observation_id":"bcb3a6e7-552d-493a-91a3-dab15c6ec1ae","resolution":{"observed_at":"2026-08-07T14:12:45.862965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:45.577870Z","title":"Stabilizing diffusion model for robotic control with dynamic programming and transition feasibility,","venue":null,"work_id":"582c1a76-9db5-46e9-b63d-92da4df4b4e8","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.870665Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:3d0e89d16b8a2fc74b0affcfceab631b7caf7ab52e971ba7303e88da318cf551","observation_id":"4e6c10ec-2b98-40fc-8f91-d205cd41a0c0","resolution":{"observed_at":"2026-08-07T14:12:45.680178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:45.329710Z","title":"Decision making with visualizations: a cognitive framework across disciplines,","venue":null,"work_id":"150dcf4c-4c3e-4954-9444-cfd59834536a","year":2018},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:37.934175Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:0e88bb5c7128c68a84dde126b9e9b02b9e3bc931a571bf08721a2750f9531da1","observation_id":"1a1cc20f-eb0e-48bd-8f7f-2541f323aaa2","resolution":{"observed_at":"2026-08-07T14:12:45.475153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:45.154420Z","title":"MAT: Morphological adaptive trans- former for universal morphology policy learning,","venue":null,"work_id":"f4138297-9e8d-4eae-83b2-2da5067d28d1","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.018053Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:2d4adad965180688a8b08604f7c88dc26fe56585a620d44220ecf17328ff41fa","observation_id":"b90ebe25-2d59-47f3-8a65-4c6ca05b7ec9","resolution":{"observed_at":"2026-08-07T14:12:45.227371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:44.955048Z","title":"Boosting continuous control with consistency policy,","venue":null,"work_id":"c40e0213-d3f7-490b-ba7a-79d08815ddec","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.057875Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:43087b74cc6d6ba3b5277b534583596f9641ecd2cfa0fb03dbedd4461383cff9","observation_id":"ed71ba69-0257-41dc-98c5-54dc3feab07a","resolution":{"observed_at":"2026-08-07T14:12:45.039267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:44.705776Z","title":"Proximal policy optimization with policy feedback,","venue":null,"work_id":"b42e45a5-8120-49ea-ab5a-2a81c67a0f88","year":2022},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.145685Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:a570bbd10752ecf755bda11c7a82ecbe95d7df3cfa6bcb7c9d1bf2367efdb9d2","observation_id":"8626712b-1b7e-47e5-888b-bd508010bb37","resolution":{"observed_at":"2026-08-07T14:12:44.844818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:44.468775Z","title":"Interactive language: Talking to robots in real time,","venue":null,"work_id":"f77fb82c-179e-434c-8a5a-8c1167c48660","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.213119Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:f45cf33b562f387a3fcbd198f54d6036c2b38485fa6e661d9401ff2d49f5be47","observation_id":"16c2e37e-f51c-466b-aa1a-d8b76582137c","resolution":{"observed_at":"2026-08-07T14:12:44.578228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:44.288136Z","title":"The surprising effectiveness of representation learning for visual imitation,","venue":null,"work_id":"dfe4490c-3b5f-4a90-a532-ecaa8c6e698f","year":2022},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.310805Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:1e66e1555e082d7b260fc315899bd657d3f5e7e54705b570506f4fd8f1567d46","observation_id":"43fb337f-fa29-4fc4-9474-ed9ebcc4b697","resolution":{"observed_at":"2026-08-07T14:12:44.369110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:44.138382Z","title":"Watch and act: Learning robotic manipulation from visual demonstration,","venue":null,"work_id":"2bb9fcdb-c32f-4a90-8d10-f7d2d781d2d9","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.394180Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:1e48e5768b4cede4057c14dd234331b62c597d7815992165805a55cc067e80bc","observation_id":"523292ed-9b83-4171-a46b-47684c13c040","resolution":{"observed_at":"2026-08-07T14:12:44.200187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:43.899871Z","title":"Apprenticeship learning via inverse reinforce- ment learning,","venue":null,"work_id":"dbcd7fa2-6eaf-4404-a1dd-f40fa74dfab1","year":2004},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.453525Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:24c6f7ca282ec62a2b89573fe8b3f788392627eec4924ec05280cb2746d77927","observation_id":"b15d748d-8a0a-425d-8dbe-0eefc7f996d5","resolution":{"observed_at":"2026-08-07T14:12:44.022355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:43.712259Z","title":"Guided cost learning: Deep inverse optimal control via policy optimization,","venue":null,"work_id":"fcc900f7-7d03-4bef-8aa8-704afea6ffa1","year":2016},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.499364Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:8dfd91826b45cdb37d8146b91fccf8b874d43e24d737bc36774dfcfa204ecb8b","observation_id":"e410135c-a395-471f-80fa-cc2e501c6dd1","resolution":{"observed_at":"2026-08-07T14:12:43.811499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:43.472116Z","title":"XIRL: cross-embodiment inverse reinforcement learning,","venue":null,"work_id":"ec30803d-3889-41b0-b198-b8f2d4f74506","year":2021},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.562239Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:9fd125b46eb0222b9cb078c9732290058c586fd401286d8b41b9de091f232cf3","observation_id":"8a3aab42-5c1e-403f-b2e3-1050e03c649f","resolution":{"observed_at":"2026-08-07T14:12:43.592043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:43.270999Z","title":"Unsupervised perceptual rewards for imitation learning,","venue":null,"work_id":"1aa9c2cd-3d8c-4cbd-9bff-3e9cbb9e106f","year":2017},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.602327Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:6688a91aeea2ef4ac6a8bbdcfb2066954c3388db4aa13469700ba034b71f3a5f","observation_id":"208e572a-6a09-43ea-a329-27ac0f909880","resolution":{"observed_at":"2026-08-07T14:12:43.363278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:43.077785Z","title":"Learning generalizable robotic reward functions from","venue":null,"work_id":"272da810-7ebf-4c35-9af0-4bd8d1deb3ce","year":2021},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.636347Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:f5589a34ad543261d1eb06ea2c0144f2e5d71a60e376621b6efbe3293870606f","observation_id":"f8b2f30f-c960-40f3-befa-a3bfe6ce27b6","resolution":{"observed_at":"2026-08-07T14:12:43.157022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:42.860868Z","title":"Can pre-trained text-to-image models generate visual goals for reinforcement learning?","venue":null,"work_id":"836b46b8-4113-4ffa-bb63-98a254cf5db4","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.677455Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:55a226132c0dc5150fe610f59f42a8ff9c0dd6baa384bd02309bb9ef1456fc4e","observation_id":"594138cd-4e9a-40e8-b77a-858a9245ce68","resolution":{"observed_at":"2026-08-07T14:12:42.973285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:42.766350Z","title":"Language instructed reinforcement learning for human-ai coordination,","venue":null,"work_id":"2f77d7e3-93c9-488c-b66e-bf645c983e7d","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.713140Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:41955fb7e8e711dd62301ea98d09f89e0d651fadcd03bf6eca45454a5a3e4719","observation_id":"90b5adef-e3bb-4709-9b87-4e6f5eaaddad","resolution":{"observed_at":"2026-08-07T14:12:42.802993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:42.615106Z","title":"Language to rewards for robotic skill synthesis,","venue":null,"work_id":"42b2afc3-448b-40c4-82ff-c9b8ef223f5d","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.770906Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:732e2041616e7e80f6f8dba3a15676bb2fad270f6639203a92a33c2a5e7f9a1b","observation_id":"4bc8b726-a2ce-4e53-a4b9-3fad6a2b9833","resolution":{"observed_at":"2026-08-07T14:12:42.666517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:42.556170Z","title":"Robogen: Towards unleashing infinite data for automated robot learning via generative simulation,","venue":null,"work_id":"f10b189d-d388-475f-ab4a-74aeb7e5040c","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.841534Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:7c8fbbe8c3fb2c9d7b109cb168f972dad60355edc9f9e6683c8ee29f27980de1","observation_id":"158d2f3b-1ed7-4a32-9688-514c3968db6f","resolution":{"observed_at":"2026-08-07T14:12:42.579438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:42.440628Z","title":"Eureka: Human-level reward design via coding large language models,","venue":null,"work_id":"ad85b70d-652e-41bd-baab-1336cee10369","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.898442Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:944020b8e21be20c00f43a4c9ef55f654e4535426073ae9764fda65ee8d3d0e9","observation_id":"3b267ee1-508a-4082-a601-92184463a9b2","resolution":{"observed_at":"2026-08-07T14:12:42.509950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:42.331007Z","title":"Vision-language models as success detectors,","venue":null,"work_id":"d57b555a-36a8-4d75-b9b7-520e9201551e","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.938950Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:34f75918387708542a5420ae9d3b263a81c0f8f6436ccc8fa00a3c6c3b4ecf60","observation_id":"31f54546-38a7-49ca-9b49-c7675c8da5d8","resolution":{"observed_at":"2026-08-07T14:12:42.404777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:42.199152Z","title":"Guiding pretraining in reinforcement learning with large language models,","venue":null,"work_id":"8ed75733-2562-420f-915b-901aff658e15","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:38.985497Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:b31ba6fbd11c3389ae4eb5c76964e57fb03fdd8fb0ad95cc639168fd981ebfdd","observation_id":"7c2d1506-22b4-4b15-9929-f653089ed579","resolution":{"observed_at":"2026-08-07T14:12:42.230637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:42.084745Z","title":"Vision-language models are zero-shot reward models for reinforcement learning,","venue":null,"work_id":"b055a800-a666-43ab-8730-a23fd201e179","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.036230Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:3d11052353de230dfd051698c61742d6a49ccccf00bc9d292a5cf177ac0bd62b","observation_id":"aafd8bb6-9e97-4c32-a0d7-c954245f4438","resolution":{"observed_at":"2026-08-07T14:12:42.156413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:41.954608Z","title":"LIV: language-image representations and rewards for robotic control,","venue":null,"work_id":"47d08439-2499-47df-aa97-035293a997fa","year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.105570Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:4e135e83bae75ebb01f126adf6dfb0cae5c8cc8a5f2f20be10f59ebdda91e709","observation_id":"9f6e7692-a622-497e-b82a-dc2409268921","resolution":{"observed_at":"2026-08-07T14:12:42.046295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:41.644149Z","title":"Llmscenario: Large language model driven scenario generation,","venue":null,"work_id":"253bb43f-aaf1-4756-b1ff-52d5435311fa","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.202104Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:bb942f4caf6322e820be715d9a477acdfbc12e2997844e9ab7aad215e5d30e22","observation_id":"9511828c-f62d-4486-9488-6da528c69c60","resolution":{"observed_at":"2026-08-07T14:12:41.759632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10639","last_updated":"2023-10-16T17:57:23Z","snapshot_observed_at":"2026-08-08T13:35:58.479807Z","submitted_at":"2023-10-16T17:57:23Z","title":"Zero-Shot Robotic Manipulation with Pretrained Image-Editing Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10639","snapshot_observed_at":"2026-08-07T14:12:39.269432Z","title":"Zero-shot robotic manipulation with pretrained image- editing diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.269432Z"},"links":{"cited_paper":"/paper/2310.10639","citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:8bd98f7c3a9a5177a2764f764f97bdc31c3021f6e0acac372c6e9d1e2b487481","observation_id":"1ae77ca1-1927-4e32-9360-ba9b95853b56","resolution":{"observed_at":"2026-08-07T14:12:39.269432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:41.436177Z","title":"Denoising diffusion implicit models,","venue":null,"work_id":"2f2c6829-e896-4abe-bc4f-68c37e7b0a23","year":2021},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.364186Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:b9dae64fc637604c5904a4135ec629e2c0be85807dd60d4bf6c2f24c5016b839","observation_id":"d21e32e1-5bce-4843-90c4-0721f22ba25d","resolution":{"observed_at":"2026-08-07T14:12:41.510138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:41.241662Z","title":"Taming transformers for high- resolution image synthesis,","venue":null,"work_id":"0191ba59-3dd7-4b8f-9608-cd2b5bbd6447","year":2021},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.441829Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:6ea67a9b9518328331aba98d21e8a9df2e3155d8472eab7932860cf4386bf348","observation_id":"ccc18db5-19c4-420e-924e-28ccc8f14de0","resolution":{"observed_at":"2026-08-07T14:12:41.358889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:41.078635Z","title":"Exploration by random network distillation,","venue":null,"work_id":"4961b91d-2a8d-4a91-8f12-6c7f929a71d2","year":2019},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.528360Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:b620ea684e79598793bdab3c75d848d09197e4af8a89c9e978eb7b1ad7c5777c","observation_id":"fb8dedd4-20e4-4fdc-8dba-e18dfc216d01","resolution":{"observed_at":"2026-08-07T14:12:41.189959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:40.891300Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning,","venue":null,"work_id":"01b9f4ac-6f67-4320-8a87-2b2c2c228d14","year":2019},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.628179Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:693fada3492d6c29ad983c9397d19797291ce38a0df448d6ae7048a5051ffc43","observation_id":"e74a59dc-86ef-468c-b20e-0455c97b71e1","resolution":{"observed_at":"2026-08-07T14:12:40.969274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:47.472612Z","title":"Learning transferable visual models from natural language supervi- sion,","venue":null,"work_id":"fda8d720-da67-47aa-8ea2-91819662dfe3","year":2021},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.707397Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:2abeff7d2bc5b91dbfa24e2f29215f9a89cb0fc9981c7f72477f9d3d5b5590a3","observation_id":"0d2eb78e-a383-4876-ad14-476908a4ada9","resolution":{"observed_at":"2026-08-07T14:12:47.571243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:40.651887Z","title":"Mastering visual continuous control: Improved data-augmented reinforcement learning,","venue":null,"work_id":"0f9a6828-03f4-4a68-9d78-0b85e42360f1","year":2022},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.778904Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:7ad73b38a2c7f933e62ea87aa027b99be85a268c658804450a9818ac7a7bf3e0","observation_id":"d859a0c4-18ee-4edd-a98c-5bd354ebe924","resolution":{"observed_at":"2026-08-07T14:12:40.768703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21845","last_updated":"2025-03-20T09:16:05Z","snapshot_observed_at":"2026-08-09T12:35:28.394011Z","submitted_at":"2024-10-29T08:12:20Z","title":"Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21845","snapshot_observed_at":"2026-08-07T14:12:39.869877Z","title":"Precise and dexterous robotic manipulation via human-in-the-loop reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.869877Z"},"links":{"cited_paper":"/paper/2410.21845","citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:41d3c2cde24e0e50117250f2b39f163eb9cc5c33b9477c8034fdc7f8d4132df9","observation_id":"317c1489-65bc-4a26-9f5b-844fd14b6e39","resolution":{"observed_at":"2026-08-07T14:12:39.869877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:40.353085Z","title":"Con- trolvideo: Training-free controllable text-to-video generation,","venue":null,"work_id":"3ea3d002-7e91-443c-a551-373d6d82ea47","year":2024},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.930879Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:8ca9f657f5348a0cd96743c2c1e157c242df2834f76024fe7769140f0c0d7022","observation_id":"83a06b74-1583-4d1f-9d23-e07fc8b507cc","resolution":{"observed_at":"2026-08-07T14:12:40.468780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:12:40.141822Z","title":"Ldr: Learning discrete representa- tion to improve noise robustness in multiagent tasks,","venue":null,"work_id":"ae04ea86-1092-4fe1-8a07-0c99a9a47aa4","year":2025},"citing_paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:12:39.980717Z"},"links":{"citing_paper":"/paper/2505.19769"},"observation_digest":"sha256:8d57a28312cfd74df2dc615e44340e74032d5c014a2ca9d835fb3a9b1e9ef495","observation_id":"242fe782-a447-48be-b781-d5e518ed0b1d","resolution":{"observed_at":"2026-08-07T14:12:40.214633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.19769","last_updated":"2025-06-24T05:29:35Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T12:36:45.639628Z","submitted_at":"2025-05-26T09:52:25Z","title":"TeViR: Text-to-Video Reward with Diffusion Models for Efficient Reinforcement Learning"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":49},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2505.19769."}