Pith. sign in

Paper Citation Record · LEDGER

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling

As of 10 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 0 inbound Pith citation observations for arXiv:2507.23391.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2507.23391 v1

Coverage vector

measured 62 of 62 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-06T10:53:06.346339Z

measured 62 of 62 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-10T06:31:04.303077+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

62 of 62 outbound references displayed

  • verified exact0
  • verified fuzzy57
  • unresolved5
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation d86a3918-632c-41cb-96db-7e84a500fd33 · outbound

This paper cites Grandmaster level in starcraft ii using multi-agent reinforcement learning,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Grandmaster level in starcraft ii using multi-agent reinforcement learning,

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.321112Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.088233Z digest=sha256:1d47a096d992d33e08c579b87de4c084571ff0d21dac0645846f1f6445a7aa44

Observation 14bd5ec2-334b-4a45-a8ee-d429ab54d3de · outbound

This paper cites Mastering the game of stratego with model-free multiagent reinforcement learning,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Mastering the game of stratego with model-free multiagent reinforcement learning,

Reference 2

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.303375Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.093365Z digest=sha256:0d7d2d7e2059477c16bb722d0ee0dc486265805a7c568eae872403285d077e6d

Observation 17d0a040-5158-448d-b2c2-46f60e144496 · outbound

This paper cites Autonomous navigation of stratospheric balloons using reinforcement learning,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Autonomous navigation of stratospheric balloons using reinforcement learning,

Reference 3

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.286207Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.098840Z digest=sha256:a34e9b3194fb9720c6cf4b6eb236693bd70b2350487ae616e8eaba210d5ef9b7

Observation 71e3c09d-2e49-45c0-b2e5-7d3349fd3205 · outbound

This paper cites Champion-level drone racing using deep reinforce- ment learning,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Champion-level drone racing using deep reinforce- ment learning,

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.271442Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.103807Z digest=sha256:65f80c5879589d945a3198c38b65e11c4a58fcadc96b71162c91859a184bf8c0

Observation 4568d228-adea-4d08-b181-4542ab7bbd6e · outbound

This paper cites Scalable deep reinforcement learning for vision-based robotic manipulation,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Scalable deep reinforcement learning for vision-based robotic manipulation,

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.253460Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.109768Z digest=sha256:c276d17a152d5fe6111976425ec82f429b003ee5d6a3811c660a11e98d94f6a1

Observation 37c59ca1-485b-49f0-bf85-3311484cbdeb · outbound

This paper cites Hindsight goal ranking on replay buffer for sparse reward environment,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Hindsight goal ranking on replay buffer for sparse reward environment,

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.226778Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.114453Z digest=sha256:3df4e61947df8da7e38d6c9a380cdf072558be5c1b3fab0a9cf3c0bde147ba96

Observation 168a47ab-deec-41d2-b009-e56515b5f845 · outbound

This paper cites Towards human-level bimanual dexterous manipulation with reinforcement learning,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Towards human-level bimanual dexterous manipulation with reinforcement learning,

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.204451Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.119415Z digest=sha256:5dd8cae1dcfbf2d455e02f32da64fb5fca209660bdc0510ba1c05072473e0965

Observation 50c51c11-9492-47af-9a70-88c7bf7445b3 · outbound

This paper cites Inverse reward design,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Inverse reward design,

Reference 8

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.189636Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.123667Z digest=sha256:4c62c1b18cf8c92b5d10414aa42c6bf1580989c2cb10a01d8c41fa786c3b9550

Observation 72ac7b64-fd7e-47fa-a629-f32c811466c5 · outbound

This paper cites Defining and characterizing reward gaming,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Defining and characterizing reward gaming,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.175458Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.127814Z digest=sha256:86316e59878349413e4b483724eccb36bf812d4b4d85167d758201f34d49ee54

Observation 33304b4d-4ea2-4024-a569-c351f393f74e · outbound

This paper cites MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-06T10:53:06.131627Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T10:53:06.131627Z digest=sha256:1dd361bad0b74fd0d527359dff5f0164d212f0e41c513cbcf46950ef56fc0513

Observation 33e373fa-455c-41a4-b86f-ae37427f8b55 · outbound

This paper cites Hear: Hearing enhanced audio response for video-grounded dialogue,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Hear: Hearing enhanced audio response for video-grounded dialogue,

Reference 11

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.161546Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.136559Z digest=sha256:4efc05e4003ccc3ed9dd121754ddfb3c185b2544e06bf99a24ddefe540551f9e

Observation 9861685b-8ecc-4ebf-84cd-ae559635bbee · outbound

This paper cites AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling AutoBench-V: Can Large Vision-Language Models Benchmark Themselves?

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-06T10:53:06.140763Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T10:53:06.140763Z digest=sha256:b4406e59d8e7802ff29220aa5185fe2b1ebad56e830487e8e1a95a74ee2d791b

Observation 3ff0ba41-1dde-4a6d-aaf5-81e551420daa · outbound

This paper cites Openvla: An open- source vision-language-action model,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Openvla: An open- source vision-language-action model,

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.148207Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.145585Z digest=sha256:5786c7fb2de367d14bc2ade46fd63b6fd79e66ef03bf0bd0d3ef5f829081459c

Observation 90785889-ab61-4ee7-baca-7740c7e856ce · outbound

This paper cites Code as reward: Empowering reinforcement learning with vlms,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Code as reward: Empowering reinforcement learning with vlms,

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.133944Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.150078Z digest=sha256:95392100aa383f51cc1799b88e353485c944167b9341162d405b6b0bbfbba54e

Observation 85304670-8ea2-448d-9050-bcfb8f5d74db · outbound

This paper cites Guiding pretraining in reinforcement learning with large language models,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Guiding pretraining in reinforcement learning with large language models,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.119511Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.154046Z digest=sha256:00154ae0809282d473ee0fae41cff8bd98c46a2e3aa59ba3d011e53035dc2911

Observation 714b9b62-b76f-476f-b886-341a23db2840 · outbound

This paper cites Bootstrap your own skills: Learning to solve new tasks with large language model guidance,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Bootstrap your own skills: Learning to solve new tasks with large language model guidance,

Reference 16

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.105934Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.158153Z digest=sha256:e884cd4abf3710da8af916e0c90ddbb293c84d450e1a4bf0e6512518ee757bbe

Observation 5e4493de-196c-412e-8578-dcd5b8cb6686 · outbound

This paper cites Code as policies: Language model programs for embodied control,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Code as policies: Language model programs for embodied control,

Reference 17

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.092568Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.162053Z digest=sha256:da98c4b94ff1841f37ced822073c985ecedc123cf1fab9f7a349581c00ce3862

Observation c85d74e0-5ce3-40af-a9b5-ffa6c0a81b6f · outbound

This paper cites Progprompt: Generating situ- ated robot task plans using large language models,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Progprompt: Generating situ- ated robot task plans using large language models,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.079466Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.166100Z digest=sha256:fda15fa2307317d4ae577e6682b60da6c411f87d5050d8773c7195c4e378acbd

Observation 5d23bd93-0fc2-44dc-9464-340108aa7af3 · outbound

This paper cites Learning transferable visual models from natural language supervision,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Learning transferable visual models from natural language supervision,

Reference 19

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.066556Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.170123Z digest=sha256:a3d310305f9935d267027ed289b3322ae0501ab1ec1fb3b817958167bd1468ca

Observation 70a94aae-ba42-47f9-9077-52c2af4d89e6 · outbound

This paper cites Roboclip: One demonstration is enough to learn robot policies,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Roboclip: One demonstration is enough to learn robot policies,

Reference 20

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.052754Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.173998Z digest=sha256:206daa9c9df3d62872c0d58f7cfa135fe5d3e0273d91f34cb690a6cdc44eec9d

Observation 8eef3b20-dae8-4971-b742-c7fc13caa125 · outbound

This paper cites Vision-language models are zero-shot reward models for reinforce- ment learning,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Vision-language models are zero-shot reward models for reinforce- ment learning,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.039310Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.178420Z digest=sha256:79453b2934b12cd32a2269d0b0f57b67a4c2ad80abc0f025dea603f703bb3e2c

Observation fbf8ed2d-8284-418f-99fa-3dc39fbebcaf · outbound

This paper cites Rl-vlm-f: Reinforcement learning from vision language foundation model feedback,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Rl-vlm-f: Reinforcement learning from vision language foundation model feedback,

Reference 22

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.025349Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.182223Z digest=sha256:6302b671c342779c80ef6532cc0c98a650aa75f84fb0535f27b82d1e2bbea8f6

Observation 550f14f4-b8f1-4d14-b23e-eb9092bb1a0e · outbound

This paper cites Language to rewards for robotic skill synthesis,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Language to rewards for robotic skill synthesis,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:07.007379Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.186024Z digest=sha256:955557c563a121eaf44bad67c6b3f3845bac088c7f2aea06aa75884fb4fe7a66

Observation 877111fb-e0e4-422f-a5cf-5b3f9e168413 · outbound

This paper cites Text2reward: Automated dense reward function generation for reinforcement learning,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Text2reward: Automated dense reward function generation for reinforcement learning,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.992559Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.190298Z digest=sha256:7c445ff1d07da53ec4d81997a3f801c416784f3df9ce27021851b0cab628064d

Observation 0733e202-e99f-439a-a7b8-d8c258473669 · outbound

This paper cites Real- world offline reinforcement learning from vision language model feedback,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Real- world offline reinforcement learning from vision language model feedback,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.976824Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.194150Z digest=sha256:5fa12449029de68609898769d88891534f95b9e1b25bce7f7e71c5bcfa082667

Observation 43179de3-2947-4c83-a0ea-d96d4e7f53b8 · outbound

This paper cites Deep reinforcement learning from human preferences,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Deep reinforcement learning from human preferences,

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.961152Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.198326Z digest=sha256:51187fc4f2d583b3f8cfa4786399843dd9e98a7fa8e501809de24a5230bcffaf

Observation be018ad3-eb4a-4589-9da2-1aaee9add368 · outbound

This paper cites B-pref: Benchmark- ing preference-based reinforcement learning,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling B-pref: Benchmark- ing preference-based reinforcement learning,

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.946274Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.202410Z digest=sha256:d2a779583c79d286c5c05fa1f48443de92ab38f2d87f8be668cc8e9ef354cd0c

Observation ef05fdd8-34a2-4753-8d8e-5f56fad7ed87 · outbound

This paper cites Inverse preference learning: Preference- based rl without a reward function,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Inverse preference learning: Preference- based rl without a reward function,

Reference 28

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.930760Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.206140Z digest=sha256:9e6747cdc38cc9634abef41831acd893b49c97d1b406931bb6e930c3be7481f4

Observation 2e30d69f-aba6-4241-a89e-b4e115485c2e · outbound

This paper cites Information- theoretic text hallucination reduction for video-grounded dialogue,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Information- theoretic text hallucination reduction for video-grounded dialogue,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.915791Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.210306Z digest=sha256:c11cb50aebeedfb3741d8f3b1f94363aa16dd85480d7d839c0373d86a9142992

Observation f4628f95-d6db-40ca-9056-8bea09610fe8 · outbound

This paper cites Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-06T10:53:06.214265Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T10:53:06.214265Z digest=sha256:71db1ea7a31329faa2a46379de99081367e5e2a3c730b53c2c7b9d12070af8cd

Observation 79335cdf-3635-4a51-9b77-e07e75cdfb78 · outbound

This paper cites ” task success.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling ” task success

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.902589Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.218449Z digest=sha256:af42631f6e54db0095bbfb4ac7bdb9be4a3fd3fc0c9e2ee51718f7e23c5c9244

Observation 8c522c47-4cd2-4e5e-b092-a9c183aac69f · outbound

This paper cites Non-markovian reward modelling from trajectory labels via interpretable multiple instance learning,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Non-markovian reward modelling from trajectory labels via interpretable multiple instance learning,

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.887933Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.222272Z digest=sha256:fa71fa78b45dcaabd28c483542365dec2d6157c3c6a45e92949e241710c80498

Observation 72d88e7a-fda6-49a0-a016-d2e5dccc8803 · outbound

This paper cites Preference transformer: Modeling human preferences using transformers for rl,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Preference transformer: Modeling human preferences using transformers for rl,

Reference 33

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.874163Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.226091Z digest=sha256:eac75ff44b3ff67ae7c21c81779e9106f78e9c5e25ace872abf090ea0a89632c

Observation 8dbda9e9-d510-449b-b719-610c18c56087 · outbound

This paper cites Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-06T10:53:06.230845Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T10:53:06.230845Z digest=sha256:befe628f4c6254643dfca0fc4887b827ad4e3c2374e16138f16e4585a8220e26

Observation 18443a1e-ce39-4706-8a92-b57986a1c008 · outbound

This paper cites Contrastive preference learning: learning from human feedback without rl,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Contrastive preference learning: learning from human feedback without rl,

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.859858Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.235540Z digest=sha256:0d89ef54bc74e4c1604b53433db35679e44b079362afdf425dafd4902dcec0b3

Observation e0db7229-ff58-482d-802c-b46eae455e41 · outbound

This paper cites Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.846472Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.240448Z digest=sha256:ece7d59f54ed91cb541b37ef56351057f9b7b8e178cf403854edefd538dd0548

Observation bbe84bfb-b9ae-474f-a2bc-5ed0905421cc · outbound

This paper cites Minedojo: Building open- ended embodied agents with internet-scale knowledge,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Minedojo: Building open- ended embodied agents with internet-scale knowledge,

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.831007Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.244892Z digest=sha256:4fba3ce0d6a2ef1815117bd6e567e0077e2fef5616528193bc2e59c7ee732944

Observation 42481d8c-6090-473e-8dd8-f976c4c9b6ac · outbound

This paper cites Liv: Language-image representations and rewards for robotic control,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Liv: Language-image representations and rewards for robotic control,

Reference 38

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.815934Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.248963Z digest=sha256:4cdb50bd3f7cc85672742df2a96bfbe6d120330d74c912d154bc06e5e4589cf0

Observation 2795730f-c34c-427c-9793-7c588fb38b78 · outbound

This paper cites Enhancing rating-based reinforcement learning to effectively leverage feedback from large vision-language models,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Enhancing rating-based reinforcement learning to effectively leverage feedback from large vision-language models,

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.801308Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.253129Z digest=sha256:789e165701a5a7eb53023b320c9fbce7727e7161e20eb37d418517bf958f6afa

Observation e63164c5-bc88-42d4-a54d-b93b68b8e753 · outbound

This paper cites Alvinn: An autonomous land vehicle in a neural network,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Alvinn: An autonomous land vehicle in a neural network,

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.785403Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.256898Z digest=sha256:f9b25f42d27b3e0461a0337564d1581d26924ef0c16e46b78e953cd9bfefb1db

Observation d7dab82b-2566-4c20-bbe7-324be4c90642 · outbound

This paper cites RT-1: Robotics Transformer for Real-World Control at Scale.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling RT-1: Robotics Transformer for Real-World Control at Scale

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-06T10:53:06.260783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-06T10:53:06.260783Z digest=sha256:4c80304de113bbc535be24975ca9d5a6180338fff7b56f38c0478201b0221a15

Observation 8707109c-e502-4633-a6ed-39610003a681 · outbound

This paper cites Interactive language: Talking to robots in real time,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Interactive language: Talking to robots in real time,

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.771071Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.265314Z digest=sha256:cce47a09f61b005f0fb5710b461fffff7c795e61fe1431ac870a519b2d90e245

Observation 01b44d5b-b02c-4643-b407-02bed96ab2ac · outbound

This paper cites Predictive coding for decision transformer,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Predictive coding for decision transformer,

Reference 43

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.757046Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.269155Z digest=sha256:a4fd0409ec5f233ca1131f80399518112d82d5683036b998dd2c387489bbd7a0

Observation b0511e0f-0019-4d67-a2d8-c5378948887e · outbound

This paper cites Algorithms for inverse reinforcement learning.,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Algorithms for inverse reinforcement learning.,

Reference 44

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.743708Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.273130Z digest=sha256:ee3eafe8767806ec0bed2c0715c45a5f3ace2889335ff2eb69e91b9040b96823

Observation 05f636e7-57df-4bfd-804d-f60467f9aa22 · outbound

This paper cites Generative adversarial imitation learning,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Generative adversarial imitation learning,

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.729304Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.277216Z digest=sha256:f5a2cd7ffa74ca96d4349edd5c964da583f84640df89e741d9897f7bb92d473f

Observation 5c874bb1-a9d9-4080-a848-c047f95b7357 · outbound

This paper cites Nonlinear inverse reinforcement learning with gaussian processes,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Nonlinear inverse reinforcement learning with gaussian processes,

Reference 46

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.712319Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.280942Z digest=sha256:7c12f68905312e834fda8474666eb93ffebcc6cc45384251c234a793209a9d8d

Observation fc0123b2-7a7a-4255-99e3-5004f8857d7b · outbound

This paper cites Guided cost learning: Deep inverse optimal control via policy optimization,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Guided cost learning: Deep inverse optimal control via policy optimization,

Reference 47

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.697777Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.285120Z digest=sha256:905c0d45798e99d3c74c2261ea33d37f852ab744ee1997b66e12d43328617718

Observation de2a873b-0c9f-4990-8f7a-3547bfe089b1 · outbound

This paper cites Learning robust rewards with adversarial inverse reinforcement learning,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Learning robust rewards with adversarial inverse reinforcement learning,

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.681468Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.289137Z digest=sha256:e992ebbe60b221974f3de4702d88be2ef2d9c07ec53f20f07b6b906db2d1549c

Observation db2a8b19-33a6-4d4a-b545-3af8aeb66942 · outbound

This paper cites Confidence-aware imitation learning from demonstrations with varying optimality,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Confidence-aware imitation learning from demonstrations with varying optimality,

Reference 49

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.656579Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.293287Z digest=sha256:51a8a27d0c8b8f80ad9d171f862ce12dd34c1737f7fb34eec9ac5a66c1d8fb4e

Observation 3cf7a57e-9f41-4a69-b1b7-6b6cdc7fdc91 · outbound

This paper cites Extrapolating beyond suboptimal demonstrations via inverse reinforcement learning from observations,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Extrapolating beyond suboptimal demonstrations via inverse reinforcement learning from observations,

Reference 50

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.641140Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.297923Z digest=sha256:d84e1111133956846371e68485dcc5cfc70d3353d64cb54153fc4406fb2f1b76

Observation 5b55927f-a36d-4880-84e3-79efe33d8432 · outbound

This paper cites Denoising diffusion probabilistic models,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Denoising diffusion probabilistic models,

Reference 51

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.626234Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.301997Z digest=sha256:6566e9e7e749af7b14c1747cca19f3eb65a269b659c3660efdb7bde3e6ad367d

Observation 39241caa-1c95-4fff-a31c-5ed6ea7859dc · outbound

This paper cites Mdsgen: Fast and efficient masked diffusion temporal-aware transformers for open-domain sound generation,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Mdsgen: Fast and efficient masked diffusion temporal-aware transformers for open-domain sound generation,

Reference 52

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.611140Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.306319Z digest=sha256:31802488ed74f5708195141151bad615982419ddadd72a48fa178286f43c77f2

Observation 9f947a2b-236d-4fd3-9404-54abcfba526a · outbound

This paper cites Taro: Timestep-adaptive repre- sentation alignment with onset-aware conditioning for synchronized video-to-audio synthesis,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Taro: Timestep-adaptive repre- sentation alignment with onset-aware conditioning for synchronized video-to-audio synthesis,

Reference 53

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.593396Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.310276Z digest=sha256:0c51c1289b5c836313700b18e2f31c08767ae32f94d8a12aad9ed45203c9d0f9

Observation 5e92706e-7a7b-4323-a8cf-85ed86701f44 · outbound

This paper cites Diffusion reward: Learning rewards via conditional video diffusion,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Diffusion reward: Learning rewards via conditional video diffusion,

Reference 54

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.578865Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.314133Z digest=sha256:339482f3de870e2b1a2ac3fba471e6859172a38679bfed16c3cbd85f288a41c5

Observation cb140fe9-36e6-4666-9332-607cb67ebe4f · outbound

This paper cites Di- rect preference-based policy optimization without reward modeling,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Di- rect preference-based policy optimization without reward modeling,

Reference 55

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.563052Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.318420Z digest=sha256:5fcf597d4d7ee13bbd8238488c872c1df72104af3a45b1cab23b5300628ac6eb

Observation 68b9331c-313b-4c30-9f7f-21f90f6926a2 · outbound

This paper cites Atari-head: Atari human eye- tracking and demonstration dataset,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Atari-head: Atari human eye- tracking and demonstration dataset,

Reference 56

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.549341Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.322397Z digest=sha256:da3b022e1e91c9859c3185c12bae0d512e79ff1021378206545f8e0d688b077e

Observation 87eedce5-eaf1-4e6b-9fe1-fceda5a9af27 · outbound

This paper cites Scanet: Scene complexity aware network for weakly-supervised video moment retrieval,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Scanet: Scene complexity aware network for weakly-supervised video moment retrieval,

Reference 57

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.535055Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.326259Z digest=sha256:4491fe9151bb7d05e7a243b72ef281382ddb2fe5b5c24122d54cd51a987c1e03

Observation 7e55aa6e-935b-4cbe-902f-f1333c2e366f · outbound

This paper cites Learning deep networks from noisy labels with dropout regularization,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Learning deep networks from noisy labels with dropout regularization,

Reference 58

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.519618Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.330269Z digest=sha256:4f53f737766db6c7018bf542834f48619298c38401df6e25d1d487770f63ffcb

Observation 10c01c1f-f6a6-456c-ad6e-3b25919a5cb2 · outbound

This paper cites Compressing features for learning with noisy labels,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Compressing features for learning with noisy labels,

Reference 59

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.505352Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.334207Z digest=sha256:60ffcb8b231861d378fb658c37e25c7c3b362eb0dace49c8bfbc637249db74fb

Observation b11d135b-c4d3-4f63-bb9c-8fc8edefdc85 · outbound

This paper cites R3m: A universal visual representation for robot manipulation,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling R3m: A universal visual representation for robot manipulation,

Reference 60

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.489708Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.338084Z digest=sha256:75222d8d5e465611c483ff8be15506daad3597a2ecdac3a8b65d96a1aaa4979d

Observation 21a841f6-0ff4-45d1-a87a-9c64886d5b75 · outbound

This paper cites Offline reinforcement learning with implicit q-learning,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Offline reinforcement learning with implicit q-learning,

Reference 61

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.474911Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.342348Z digest=sha256:e92f9cb27d123489b5563a8d3a9b60d95db5484e28cf5e6c78dcf0764b6fa7e7

Observation 071a7a7b-21da-46ea-a460-94122014cc96 · outbound

This paper cites Rime: Robust preference-based reinforcement learning with noisy preferences,.

Policy Learning from Large Vision-Language Model Feedback without Reward Modeling Rime: Robust preference-based reinforcement learning with noisy preferences,

Reference 62

Resolution
verified fuzzy
raw_fallback, observed 2026-08-06T10:53:06.460060Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.

source=pdf_text observed=2026-08-06T10:53:06.346339Z digest=sha256:52728ec21520b529e4716561901ad3386ca872d6814fb1e0d7201a4a112cc47c

Pith citing papers

No inbound Pith citation observations are available.