{"as_of":"2026-08-10T09:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:edcedc3a537b7fb7f97204414a67be8f9ca424e1767980ebe8f85986b73b4c30","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:53:06.346339Z","state":"measured"},{"denominator":62,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":62,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.23391/citation-record","integrity":"/paper/2507.23391/integrity","json":"/paper/2507.23391/citation-record.json","paper":"/paper/2507.23391"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.314191Z","title":"Grandmaster level in starcraft ii using multi-agent reinforcement learning,","venue":null,"work_id":"1d21140c-99f3-4001-a372-3b6735672eb3","year":2019},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.088233Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:1d47a096d992d33e08c579b87de4c084571ff0d21dac0645846f1f6445a7aa44","observation_id":"d86a3918-632c-41cb-96db-7e84a500fd33","resolution":{"observed_at":"2026-08-06T10:53:07.321112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.297862Z","title":"Mastering the game of stratego with model-free multiagent reinforcement learning,","venue":null,"work_id":"19cb1438-3e6f-4a65-be00-309c2582820f","year":2022},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.093365Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:0d7d2d7e2059477c16bb722d0ee0dc486265805a7c568eae872403285d077e6d","observation_id":"14bd5ec2-334b-4a45-a8ee-d429ab54d3de","resolution":{"observed_at":"2026-08-06T10:53:07.303375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.280630Z","title":"Autonomous navigation of stratospheric balloons using reinforcement learning,","venue":null,"work_id":"4a435e89-2d04-429d-a7e4-bc8851414d5f","year":2020},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.098840Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:a34e9b3194fb9720c6cf4b6eb236693bd70b2350487ae616e8eaba210d5ef9b7","observation_id":"17d0a040-5158-448d-b2c2-46f60e144496","resolution":{"observed_at":"2026-08-06T10:53:07.286207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.266594Z","title":"Champion-level drone racing using deep reinforce- ment learning,","venue":null,"work_id":"ac00957f-9f5e-4100-8b0f-517814e9b2ff","year":2023},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.103807Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:65f80c5879589d945a3198c38b65e11c4a58fcadc96b71162c91859a184bf8c0","observation_id":"71e3c09d-2e49-45c0-b2e5-7d3349fd3205","resolution":{"observed_at":"2026-08-06T10:53:07.271442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.245417Z","title":"Scalable deep reinforcement learning for vision-based robotic manipulation,","venue":null,"work_id":"1dc4b8f0-0a1e-407a-8532-f153bdc58a86","year":2018},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.109768Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:c276d17a152d5fe6111976425ec82f429b003ee5d6a3811c660a11e98d94f6a1","observation_id":"4568d228-adea-4d08-b181-4542ab7bbd6e","resolution":{"observed_at":"2026-08-06T10:53:07.253460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.218458Z","title":"Hindsight goal ranking on replay buffer for sparse reward environment,","venue":null,"work_id":"bb0627c9-9b0f-48fa-8021-29e43d458e5e","year":2021},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.114453Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:3df4e61947df8da7e38d6c9a380cdf072558be5c1b3fab0a9cf3c0bde147ba96","observation_id":"37c59ca1-485b-49f0-bf85-3311484cbdeb","resolution":{"observed_at":"2026-08-06T10:53:07.226778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.198957Z","title":"Towards human-level bimanual dexterous manipulation with reinforcement learning,","venue":null,"work_id":"2ed20a34-733b-44f5-a80f-7bd03d91c69f","year":2022},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.119415Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:5dd8cae1dcfbf2d455e02f32da64fb5fca209660bdc0510ba1c05072473e0965","observation_id":"168a47ab-deec-41d2-b009-e56515b5f845","resolution":{"observed_at":"2026-08-06T10:53:07.204451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.185388Z","title":"Inverse reward design,","venue":null,"work_id":"8e45d6d6-2e7e-4de7-b14e-480a9da29e38","year":2017},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.123667Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:4c62c1b18cf8c92b5d10414aa42c6bf1580989c2cb10a01d8c41fa786c3b9550","observation_id":"50c51c11-9492-47af-9a70-88c7bf7445b3","resolution":{"observed_at":"2026-08-06T10:53:07.189636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.171126Z","title":"Defining and characterizing reward gaming,","venue":null,"work_id":"0d3addc9-1fbb-4c60-93a3-ad4ef43ec5d2","year":2022},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.127814Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:86316e59878349413e4b483724eccb36bf812d4b4d85167d758201f34d49ee54","observation_id":"72ac7b64-fd7e-47fa-a629-f32c811466c5","resolution":{"observed_at":"2026-08-06T10:53:07.175458Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T10:53:06.131627Z","title":"Minigpt-4: En- hancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.131627Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:1dd361bad0b74fd0d527359dff5f0164d212f0e41c513cbcf46950ef56fc0513","observation_id":"33304b4d-4ea2-4024-a569-c351f393f74e","resolution":{"observed_at":"2026-08-06T10:53:06.131627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.157417Z","title":"Hear: Hearing enhanced audio response for video-grounded dialogue,","venue":null,"work_id":"df2d72de-08ad-4fad-98e2-ee3c2b5ac904","year":2023},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.136559Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:4efc05e4003ccc3ed9dd121754ddfb3c185b2544e06bf99a24ddefe540551f9e","observation_id":"33e373fa-455c-41a4-b86f-ae37427f8b55","resolution":{"observed_at":"2026-08-06T10:53:07.161546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21259","last_updated":"2025-03-06T03:31:32Z","snapshot_observed_at":"2026-07-06T19:40:57.049203Z","submitted_at":"2024-10-28T17:55:08Z","title":"AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21259","snapshot_observed_at":"2026-08-06T10:53:06.140763Z","title":"Autobench-v: Can large vision-language models benchmark themselves?,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.140763Z"},"links":{"cited_paper":"/paper/2410.21259","citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:b4406e59d8e7802ff29220aa5185fe2b1ebad56e830487e8e1a95a74ee2d791b","observation_id":"9861685b-8ecc-4ebf-84cd-ae559635bbee","resolution":{"observed_at":"2026-08-06T10:53:06.140763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.143844Z","title":"Openvla: An open- source vision-language-action model,","venue":null,"work_id":"853778c6-ea16-433a-951c-7369bba20c55","year":2024},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.145585Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:5786c7fb2de367d14bc2ade46fd63b6fd79e66ef03bf0bd0d3ef5f829081459c","observation_id":"3ff0ba41-1dde-4a6d-aaf5-81e551420daa","resolution":{"observed_at":"2026-08-06T10:53:07.148207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.129274Z","title":"Code as reward: Empowering reinforcement learning with vlms,","venue":null,"work_id":"f507e343-c1f9-4aea-b180-0102fa973f44","year":2024},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.150078Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:95392100aa383f51cc1799b88e353485c944167b9341162d405b6b0bbfbba54e","observation_id":"90785889-ab61-4ee7-baca-7740c7e856ce","resolution":{"observed_at":"2026-08-06T10:53:07.133944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.114813Z","title":"Guiding pretraining in reinforcement learning with large language models,","venue":null,"work_id":"24c85e7d-1efd-4e5c-bde1-715b280c1652","year":2023},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.154046Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:00154ae0809282d473ee0fae41cff8bd98c46a2e3aa59ba3d011e53035dc2911","observation_id":"85304670-8ea2-448d-9050-bcfb8f5d74db","resolution":{"observed_at":"2026-08-06T10:53:07.119511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.101742Z","title":"Bootstrap your own skills: Learning to solve new tasks with large language model guidance,","venue":null,"work_id":"ed6421e3-879b-487f-84f0-c25292be1285","year":2023},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.158153Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:e884cd4abf3710da8af916e0c90ddbb293c84d450e1a4bf0e6512518ee757bbe","observation_id":"714b9b62-b76f-476f-b886-341a23db2840","resolution":{"observed_at":"2026-08-06T10:53:07.105934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.088221Z","title":"Code as policies: Language model programs for embodied control,","venue":null,"work_id":"27adfaff-5760-4b19-b049-20315b648d08","year":2023},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.162053Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:da98c4b94ff1841f37ced822073c985ecedc123cf1fab9f7a349581c00ce3862","observation_id":"5e4493de-196c-412e-8578-dcd5b8cb6686","resolution":{"observed_at":"2026-08-06T10:53:07.092568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.075345Z","title":"Progprompt: Generating situ- ated robot task plans using large language models,","venue":null,"work_id":"aafc4475-d93e-4dbe-82bb-f8752d26c285","year":2023},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.166100Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:fda15fa2307317d4ae577e6682b60da6c411f87d5050d8773c7195c4e378acbd","observation_id":"c85d74e0-5ce3-40af-a9b5-ffa6c0a81b6f","resolution":{"observed_at":"2026-08-06T10:53:07.079466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.062424Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"6f7885d2-8c78-4915-9468-babe494307ed","year":2021},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.170123Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:a3d310305f9935d267027ed289b3322ae0501ab1ec1fb3b817958167bd1468ca","observation_id":"5d23bd93-0fc2-44dc-9464-340108aa7af3","resolution":{"observed_at":"2026-08-06T10:53:07.066556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.048582Z","title":"Roboclip: One demonstration is enough to learn robot policies,","venue":null,"work_id":"b3c3fb62-303c-4581-a6d9-ec413c02adcb","year":2024},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.173998Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:206daa9c9df3d62872c0d58f7cfa135fe5d3e0273d91f34cb690a6cdc44eec9d","observation_id":"70a94aae-ba42-47f9-9077-52c2af4d89e6","resolution":{"observed_at":"2026-08-06T10:53:07.052754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.035059Z","title":"Vision-language models are zero-shot reward models for reinforce- ment learning,","venue":null,"work_id":"e51da141-723f-4f8d-884f-ded1125adab7","year":2024},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.178420Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:79453b2934b12cd32a2269d0b0f57b67a4c2ad80abc0f025dea603f703bb3e2c","observation_id":"8eef3b20-dae8-4971-b742-c7fc13caa125","resolution":{"observed_at":"2026-08-06T10:53:07.039310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.017521Z","title":"Rl-vlm-f: Reinforcement learning from vision language foundation model feedback,","venue":null,"work_id":"73cdd739-9047-4015-b9a1-fa14c78e520a","year":2024},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.182223Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:6302b671c342779c80ef6532cc0c98a650aa75f84fb0535f27b82d1e2bbea8f6","observation_id":"fbf8ed2d-8284-418f-99fa-3dc39fbebcaf","resolution":{"observed_at":"2026-08-06T10:53:07.025349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:07.002945Z","title":"Language to rewards for robotic skill synthesis,","venue":null,"work_id":"126aaec8-92db-4529-854e-b73f461ff8ff","year":2023},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.186024Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:955557c563a121eaf44bad67c6b3f3845bac088c7f2aea06aa75884fb4fe7a66","observation_id":"550f14f4-b8f1-4d14-b23e-eb9092bb1a0e","resolution":{"observed_at":"2026-08-06T10:53:07.007379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.987753Z","title":"Text2reward: Automated dense reward function generation for reinforcement learning,","venue":null,"work_id":"3268e2b1-9bee-4044-ac93-6929b87030b8","year":2024},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.190298Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:7c445ff1d07da53ec4d81997a3f801c416784f3df9ce27021851b0cab628064d","observation_id":"877111fb-e0e4-422f-a5cf-5b3f9e168413","resolution":{"observed_at":"2026-08-06T10:53:06.992559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.971768Z","title":"Real- world offline reinforcement learning from vision language model feedback,","venue":null,"work_id":"7d6feeaa-f2b4-4ab3-bb95-45b7ec1b9800","year":2024},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.194150Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:5fa12449029de68609898769d88891534f95b9e1b25bce7f7e71c5bcfa082667","observation_id":"0733e202-e99f-439a-a7b8-d8c258473669","resolution":{"observed_at":"2026-08-06T10:53:06.976824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.955970Z","title":"Deep reinforcement learning from human preferences,","venue":null,"work_id":"14ab1aa5-16dd-412d-87c7-8f04975056f7","year":2017},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.198326Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:51187fc4f2d583b3f8cfa4786399843dd9e98a7fa8e501809de24a5230bcffaf","observation_id":"43179de3-2947-4c83-a0ea-d96d4e7f53b8","resolution":{"observed_at":"2026-08-06T10:53:06.961152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.941449Z","title":"B-pref: Benchmark- ing preference-based reinforcement learning,","venue":null,"work_id":"692876e2-11fb-40ee-9ad6-d4ca3964e662","year":2021},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.202410Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:d2a779583c79d286c5c05fa1f48443de92ab38f2d87f8be668cc8e9ef354cd0c","observation_id":"be018ad3-eb4a-4589-9da2-1aaee9add368","resolution":{"observed_at":"2026-08-06T10:53:06.946274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.925891Z","title":"Inverse preference learning: Preference- based rl without a reward function,","venue":null,"work_id":"3020720b-97eb-4c11-a12b-7f56f2dacc04","year":2023},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.206140Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:9e6747cdc38cc9634abef41831acd893b49c97d1b406931bb6e930c3be7481f4","observation_id":"ef05fdd8-34a2-4753-8d8e-5f56fad7ed87","resolution":{"observed_at":"2026-08-06T10:53:06.930760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.911396Z","title":"Information- theoretic text hallucination reduction for video-grounded dialogue,","venue":null,"work_id":"4e13b156-1da4-4c40-9625-6f763b1dd2fe","year":2022},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.210306Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:c11cb50aebeedfb3741d8f3b1f94363aa16dd85480d7d839c0373d86a9142992","observation_id":"2e30d69f-aba6-4241-a89e-b4e115485c2e","resolution":{"observed_at":"2026-08-06T10:53:06.915791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01219","last_updated":"2025-09-14T09:34:46Z","snapshot_observed_at":"2026-07-06T16:13:46.112815Z","submitted_at":"2023-09-03T16:56:48Z","title":"Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01219","snapshot_observed_at":"2026-08-06T10:53:06.214265Z","title":"Siren’s song in the ai ocean: a survey on hallucination in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.214265Z"},"links":{"cited_paper":"/paper/2309.01219","citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:71db1ea7a31329faa2a46379de99081367e5e2a3c730b53c2c7b9d12070af8cd","observation_id":"f4628f95-d6db-40ca-9056-8bea09610fe8","resolution":{"observed_at":"2026-08-06T10:53:06.214265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.897820Z","title":"” task success","venue":null,"work_id":"b001c7d5-9aec-44be-9114-ef608302510c","year":2024},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.218449Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:af42631f6e54db0095bbfb4ac7bdb9be4a3fd3fc0c9e2ee51718f7e23c5c9244","observation_id":"79335cdf-3635-4a51-9b77-e07e75cdfb78","resolution":{"observed_at":"2026-08-06T10:53:06.902589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.883376Z","title":"Non-markovian reward modelling from trajectory labels via interpretable multiple instance learning,","venue":null,"work_id":"f665ee63-0b6f-4e22-9b58-8481d4a02dae","year":2022},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.222272Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:fa71fa78b45dcaabd28c483542365dec2d6157c3c6a45e92949e241710c80498","observation_id":"8c522c47-4cd2-4e5e-b092-a9c183aac69f","resolution":{"observed_at":"2026-08-06T10:53:06.887933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.869825Z","title":"Preference transformer: Modeling human preferences using transformers for rl,","venue":null,"work_id":"0238b273-4347-4369-a0f0-a916da0e598e","year":2023},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.226091Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:eac75ff44b3ff67ae7c21c81779e9106f78e9c5e25ace872abf090ea0a89632c","observation_id":"72d88e7a-fda6-49a0-a016-d2e5dccc8803","resolution":{"observed_at":"2026-08-06T10:53:06.874163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T10:53:06.230845Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.230845Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:befe628f4c6254643dfca0fc4887b827ad4e3c2374e16138f16e4585a8220e26","observation_id":"8dbda9e9-d510-449b-b719-610c18c56087","resolution":{"observed_at":"2026-08-06T10:53:06.230845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.855551Z","title":"Contrastive preference learning: learning from human feedback without rl,","venue":null,"work_id":"f119a7cb-396a-4399-a117-1fd87f573e49","year":2024},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.235540Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:0d89ef54bc74e4c1604b53433db35679e44b079362afdf425dafd4902dcec0b3","observation_id":"18443a1e-ce39-4706-8a92-b57986a1c008","resolution":{"observed_at":"2026-08-06T10:53:06.859858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.842077Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning,","venue":null,"work_id":"9e57a4a2-0c2d-4238-a937-dd5ada1c54f8","year":2020},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.240448Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:ece7d59f54ed91cb541b37ef56351057f9b7b8e178cf403854edefd538dd0548","observation_id":"e0db7229-ff58-482d-802c-b46eae455e41","resolution":{"observed_at":"2026-08-06T10:53:06.846472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.826492Z","title":"Minedojo: Building open- ended embodied agents with internet-scale knowledge,","venue":null,"work_id":"217dc71e-0fb2-4952-8f02-7d299b99688f","year":2022},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.244892Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:4fba3ce0d6a2ef1815117bd6e567e0077e2fef5616528193bc2e59c7ee732944","observation_id":"bbe84bfb-b9ae-474f-a2bc-5ed0905421cc","resolution":{"observed_at":"2026-08-06T10:53:06.831007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.811720Z","title":"Liv: Language-image representations and rewards for robotic control,","venue":null,"work_id":"43a1d1e7-9bf9-4fb4-a420-3f83a91d6285","year":2023},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.248963Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:4cdb50bd3f7cc85672742df2a96bfbe6d120330d74c912d154bc06e5e4589cf0","observation_id":"42481d8c-6090-473e-8dd8-f976c4c9b6ac","resolution":{"observed_at":"2026-08-06T10:53:06.815934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.796298Z","title":"Enhancing rating-based reinforcement learning to effectively leverage feedback from large vision-language models,","venue":null,"work_id":"1a4f128c-0a66-419a-8bd1-4cfde8b3bc31","year":2025},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.253129Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:789e165701a5a7eb53023b320c9fbce7727e7161e20eb37d418517bf958f6afa","observation_id":"2795730f-c34c-427c-9793-7c588fb38b78","resolution":{"observed_at":"2026-08-06T10:53:06.801308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.780321Z","title":"Alvinn: An autonomous land vehicle in a neural network,","venue":null,"work_id":"a7ea5452-495f-4deb-9292-67bb5dd457ed","year":1988},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.256898Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:f9b25f42d27b3e0461a0337564d1581d26924ef0c16e46b78e953cd9bfefb1db","observation_id":"e63164c5-bc88-42d4-a54d-b93b68b8e753","resolution":{"observed_at":"2026-08-06T10:53:06.785403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-06T10:53:06.260783Z","title":"Rt-1: Robotics transformer for real-world control at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.260783Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:4c80304de113bbc535be24975ca9d5a6180338fff7b56f38c0478201b0221a15","observation_id":"d7dab82b-2566-4c20-bbe7-324be4c90642","resolution":{"observed_at":"2026-08-06T10:53:06.260783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.766683Z","title":"Interactive language: Talking to robots in real time,","venue":null,"work_id":"1a9efe91-94c2-4e0d-bccf-4854996808ae","year":2023},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.265314Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:cce47a09f61b005f0fb5710b461fffff7c795e61fe1431ac870a519b2d90e245","observation_id":"8707109c-e502-4633-a6ed-39610003a681","resolution":{"observed_at":"2026-08-06T10:53:06.771071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.752884Z","title":"Predictive coding for decision transformer,","venue":null,"work_id":"3a37eb09-91cb-4631-bef0-93c28d1b24ce","year":2024},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.269155Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:a4fd0409ec5f233ca1131f80399518112d82d5683036b998dd2c387489bbd7a0","observation_id":"01b44d5b-b02c-4643-b407-02bed96ab2ac","resolution":{"observed_at":"2026-08-06T10:53:06.757046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.739366Z","title":"Algorithms for inverse reinforcement learning.,","venue":null,"work_id":"b808292f-8f55-43e3-ad0f-c9efed0d5661","year":2000},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.273130Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:ee3eafe8767806ec0bed2c0715c45a5f3ace2889335ff2eb69e91b9040b96823","observation_id":"b0511e0f-0019-4d67-a2d8-c5378948887e","resolution":{"observed_at":"2026-08-06T10:53:06.743708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.724922Z","title":"Generative adversarial imitation learning,","venue":null,"work_id":"965e51f0-85fa-46e8-998c-e70c787a93c7","year":2016},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.277216Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:f5a2cd7ffa74ca96d4349edd5c964da583f84640df89e741d9897f7bb92d473f","observation_id":"05f636e7-57df-4bfd-804d-f60467f9aa22","resolution":{"observed_at":"2026-08-06T10:53:06.729304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.707980Z","title":"Nonlinear inverse reinforcement learning with gaussian processes,","venue":null,"work_id":"9aec032b-0f9c-483c-b701-61671fd6922e","year":2011},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.280942Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:7c12f68905312e834fda8474666eb93ffebcc6cc45384251c234a793209a9d8d","observation_id":"5c874bb1-a9d9-4080-a848-c047f95b7357","resolution":{"observed_at":"2026-08-06T10:53:06.712319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.692563Z","title":"Guided cost learning: Deep inverse optimal control via policy optimization,","venue":null,"work_id":"28333f5a-c592-4a90-b56f-25d918f919a9","year":2016},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.285120Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:905c0d45798e99d3c74c2261ea33d37f852ab744ee1997b66e12d43328617718","observation_id":"fc0123b2-7a7a-4255-99e3-5004f8857d7b","resolution":{"observed_at":"2026-08-06T10:53:06.697777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.673069Z","title":"Learning robust rewards with adversarial inverse reinforcement learning,","venue":null,"work_id":"37ea9328-8278-41fe-abce-6916d5a04897","year":2018},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.289137Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:e992ebbe60b221974f3de4702d88be2ef2d9c07ec53f20f07b6b906db2d1549c","observation_id":"de2a873b-0c9f-4990-8f7a-3547bfe089b1","resolution":{"observed_at":"2026-08-06T10:53:06.681468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.651626Z","title":"Confidence-aware imitation learning from demonstrations with varying optimality,","venue":null,"work_id":"1db478ac-85e2-4191-993d-7a8310fc98ed","year":2021},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.293287Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:51a8a27d0c8b8f80ad9d171f862ce12dd34c1737f7fb34eec9ac5a66c1d8fb4e","observation_id":"db2a8b19-33a6-4d4a-b545-3af8aeb66942","resolution":{"observed_at":"2026-08-06T10:53:06.656579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.636257Z","title":"Extrapolating beyond suboptimal demonstrations via inverse reinforcement learning from observations,","venue":null,"work_id":"8e142f52-a773-4f93-8403-f6c2302bf4f7","year":2019},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.297923Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:d84e1111133956846371e68485dcc5cfc70d3353d64cb54153fc4406fb2f1b76","observation_id":"3cf7a57e-9f41-4a69-b1b7-6b6cdc7fdc91","resolution":{"observed_at":"2026-08-06T10:53:06.641140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.621843Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":"4a0ecb35-fe2f-42ae-b98a-e8a6fbaa42cd","year":2020},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.301997Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:6566e9e7e749af7b14c1747cca19f3eb65a269b659c3660efdb7bde3e6ad367d","observation_id":"5b55927f-a36d-4880-84e3-79efe33d8432","resolution":{"observed_at":"2026-08-06T10:53:06.626234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.604740Z","title":"Mdsgen: Fast and efficient masked diffusion temporal-aware transformers for open-domain sound generation,","venue":null,"work_id":"fcc9bb17-9f16-439d-b501-8ac87b06ca64","year":2025},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.306319Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:31802488ed74f5708195141151bad615982419ddadd72a48fa178286f43c77f2","observation_id":"39241caa-1c95-4fff-a31c-5ed6ea7859dc","resolution":{"observed_at":"2026-08-06T10:53:06.611140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.588722Z","title":"Taro: Timestep-adaptive repre- sentation alignment with onset-aware conditioning for synchronized video-to-audio synthesis,","venue":null,"work_id":"2c03a191-5108-4561-9f0b-86a92a976753","year":2025},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.310276Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:0c51c1289b5c836313700b18e2f31c08767ae32f94d8a12aad9ed45203c9d0f9","observation_id":"9f947a2b-236d-4fd3-9404-54abcfba526a","resolution":{"observed_at":"2026-08-06T10:53:06.593396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.574365Z","title":"Diffusion reward: Learning rewards via conditional video diffusion,","venue":null,"work_id":"f0440959-b04f-4425-9e6a-39ce0aaac8cf","year":2024},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.314133Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:339482f3de870e2b1a2ac3fba471e6859172a38679bfed16c3cbd85f288a41c5","observation_id":"5e92706e-7a7b-4323-a8cf-85ed86701f44","resolution":{"observed_at":"2026-08-06T10:53:06.578865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.558542Z","title":"Di- rect preference-based policy optimization without reward modeling,","venue":null,"work_id":"045365cf-b494-4cbc-bde0-90366bec2f69","year":2023},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.318420Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:5fcf597d4d7ee13bbd8238488c872c1df72104af3a45b1cab23b5300628ac6eb","observation_id":"cb140fe9-36e6-4666-9332-607cb67ebe4f","resolution":{"observed_at":"2026-08-06T10:53:06.563052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.544970Z","title":"Atari-head: Atari human eye- tracking and demonstration dataset,","venue":null,"work_id":"aa8dcee2-7a77-4903-acaa-94ea100110f7","year":2020},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.322397Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:da3b022e1e91c9859c3185c12bae0d512e79ff1021378206545f8e0d688b077e","observation_id":"68b9331c-313b-4c30-9f7f-21f90f6926a2","resolution":{"observed_at":"2026-08-06T10:53:06.549341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.529780Z","title":"Scanet: Scene complexity aware network for weakly-supervised video moment retrieval,","venue":null,"work_id":"11b7a226-f730-4015-9ca3-1b70e34f8e82","year":2023},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.326259Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:4491fe9151bb7d05e7a243b72ef281382ddb2fe5b5c24122d54cd51a987c1e03","observation_id":"87eedce5-eaf1-4e6b-9fe1-fceda5a9af27","resolution":{"observed_at":"2026-08-06T10:53:06.535055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.515267Z","title":"Learning deep networks from noisy labels with dropout regularization,","venue":null,"work_id":"faa20c44-4941-4b8f-93f0-474f290edb08","year":2017},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.330269Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:4f53f737766db6c7018bf542834f48619298c38401df6e25d1d487770f63ffcb","observation_id":"7e55aa6e-935b-4cbe-902f-f1333c2e366f","resolution":{"observed_at":"2026-08-06T10:53:06.519618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.500612Z","title":"Compressing features for learning with noisy labels,","venue":null,"work_id":"a64db9ca-79f9-4f71-9573-e247bc957f2a","year":2022},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.334207Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:60ffcb8b231861d378fb658c37e25c7c3b362eb0dace49c8bfbc637249db74fb","observation_id":"10c01c1f-f6a6-456c-ad6e-3b25919a5cb2","resolution":{"observed_at":"2026-08-06T10:53:06.505352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.484901Z","title":"R3m: A universal visual representation for robot manipulation,","venue":null,"work_id":"d60acabd-3459-44e4-92ce-2b958e66852a","year":2022},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.338084Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:75222d8d5e465611c483ff8be15506daad3597a2ecdac3a8b65d96a1aaa4979d","observation_id":"b11d135b-c4d3-4f63-bb9c-8fc8edefdc85","resolution":{"observed_at":"2026-08-06T10:53:06.489708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.470476Z","title":"Offline reinforcement learning with implicit q-learning,","venue":null,"work_id":"2be8d458-b39e-48d9-ab70-67d7d24fa34e","year":2022},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.342348Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:e92f9cb27d123489b5563a8d3a9b60d95db5484e28cf5e6c78dcf0764b6fa7e7","observation_id":"21a841f6-0ff4-45d1-a87a-9c64886d5b75","resolution":{"observed_at":"2026-08-06T10:53:06.474911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:53:06.453405Z","title":"Rime: Robust preference-based reinforcement learning with noisy preferences,","venue":null,"work_id":"d5eafa29-c079-44d9-abab-fd4607c2f6fd","year":2024},"citing_paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T10:53:06.346339Z"},"links":{"citing_paper":"/paper/2507.23391"},"observation_digest":"sha256:52728ec21520b529e4716561901ad3386ca872d6814fb1e0d7201a4a112cc47c","observation_id":"071a7a7b-21da-46ea-a460-94122014cc96","resolution":{"observed_at":"2026-08-06T10:53:06.460060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.23391","last_updated":"2025-07-31T10:07:49Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T22:01:48.274112Z","submitted_at":"2025-07-31T10:07:49Z","title":"Policy Learning from Large Vision-Language Model Feedback without Reward Modeling"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":0,"verified_fuzzy":57},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2507.23391."}