Pith. sign in

Paper Citation Record · LEDGER

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models

As of 15 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2608.08491.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2608.08491 v1

Coverage vector

measured 52 of 52 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-14T04:40:11.975172Z

measured 52 of 52 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-15T06:32:42.880941+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

52 of 52 outbound references displayed

  • verified exact0
  • verified fuzzy17
  • unresolved35
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation e0d22af6-881a-40a9-ad56-cfcaa581314c · outbound

This paper cites Eureka: Human-level reward design via coding large language models.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Eureka: Human-level reward design via coding large language models

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.587619Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-14T04:40:11.779147Z digest=sha256:3441ae7719e02e950abe849d6f38ee819c744d45dc268719262ef8c7d4eec30d

Observation e5ab305d-2dae-49b4-8184-b6bda825693b · outbound

This paper cites Serl: A software suite for sample- efficient robotic reinforcement learning.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Serl: A software suite for sample- efficient robotic reinforcement learning

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.784324Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.784324Z digest=sha256:f45d019969c7e7bb8f29bc9f03f0b9165e92263ef2ff9b28c53e69e5f8d2c007

Observation 62a73c9e-3392-40cf-a88e-febe6f022191 · outbound

This paper cites Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.788149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.788149Z digest=sha256:4d37cd33e39a5c0e90e977135a2352c3ce2dd07bd7cbc21767d735deaccb1221

Observation 2e38b2f5-f651-47ad-923c-a4f7d76c52ea · outbound

This paper cites Improving vision-language-action model with online reinforcement learning.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Improving vision-language-action model with online reinforcement learning

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.792711Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.792711Z digest=sha256:349c4e65a4611eb0a84f1b2c8a42688a3d2649b4fc45da7ed4b370aefaf3fdae

Observation 769055bf-55da-4452-90ad-e1cce2da1523 · outbound

This paper cites Robot-r1: Reinforcement learning for enhanced embodied reasoning in robotics.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Robot-r1: Reinforcement learning for enhanced embodied reasoning in robotics

Reference 5

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.554576Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-14T04:40:11.796781Z digest=sha256:86606be93ee5b9e167fcbc67d4b415cb404e6256c6896a0eb394b93d1ccaca59

Observation 9ca47e5f-3f36-4b14-8605-de65615983c1 · outbound

This paper cites Reinforcement learning with foundation priors: Let embodied agent efficiently learn on its own.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Reinforcement learning with foundation priors: Let embodied agent efficiently learn on its own

Reference 6

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.541917Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-14T04:40:11.800620Z digest=sha256:46016514ce2ecf20509851f6b7904d86e994e7fc5bd67a4fea5083ef0818ff7e

Observation 30d88430-1e91-41cd-822f-e86ab0170b9f · outbound

This paper cites Self-improving embodied foundation models.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Self-improving embodied foundation models

Reference 7

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.529740Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-14T04:40:11.804984Z digest=sha256:23d95cbaadf6f76df1510cd95c5720344c0500bbc4f70eabee8c60687ab406cf

Observation d9f4bd21-72a3-4fa7-9909-efd9b3646c86 · outbound

This paper cites Deep reinforcement learning from human preferences.Advances in neural information processing systems, 30, 2017.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Deep reinforcement learning from human preferences.Advances in neural information processing systems, 30, 2017

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.809335Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.809335Z digest=sha256:17399e7348f79800df9aa05d9ef77374a4e072bcdd42603372fe37e8f5ef3067

Observation ee2fe596-3c97-4093-a37c-1e5df48ade05 · outbound

This paper cites Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, et al.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, et al

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.510106Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-14T04:40:11.813385Z digest=sha256:5d6511cbb62ce6a3d90317413cb4d8555a6ba496eded318219e0c03383dd0c29

Observation 6d2e1e5f-42ba-49b0-9dfc-961bd938fc13 · outbound

This paper cites Roboreward: General-purpose vision-language reward models for robotics.arXiv preprint arXiv:2601.00675, 2026.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Roboreward: General-purpose vision-language reward models for robotics.arXiv preprint arXiv:2601.00675, 2026

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.817154Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.817154Z digest=sha256:a53fc8a5875b1ec2d0a3116b52521bb3611131d34e751e8ebf4e1f5cc212bbec

Observation c6ced9ac-b537-47b1-b6e7-e1ea237941f2 · outbound

This paper cites DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.820969Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.820969Z digest=sha256:e80bd024953bfd0b2cc2d4996b2810f32520eb18f5795d1a99c52b5f8ecb4970

Observation 5e30c658-ab9d-462b-9014-8f3557ebefcc · outbound

This paper cites Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv e-prints, pages arXiv–2501, 2025.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv e-prints, pages arXiv–2501, 2025

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.497747Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-14T04:40:11.824989Z digest=sha256:a7dc3bba54f58b60e1ba2b1728ae56a24f349ceaddb0d61639dc45514801494d

Observation c4470bf2-8fcc-4120-8bdb-1f8db33533c1 · outbound

This paper cites rstar-math: Small llms can master math reasoning with self-evolved deep thinking.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models rstar-math: Small llms can master math reasoning with self-evolved deep thinking

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.485788Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-14T04:40:11.828550Z digest=sha256:196d376d13ee3164d4abdefaab3e60464fc1895b1044baf6d60951ca12e38afe

Observation 1cddd270-4b8e-4d7d-9528-9d61ca4b08e2 · outbound

This paper cites Training software engineering agents and verifiers with swe-gym.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Training software engineering agents and verifiers with swe-gym

Reference 14

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.474431Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-14T04:40:11.832736Z digest=sha256:263bb3aabfc66da9063413def1b51a78a6b649440bf2d7daee3cf6c3eb2dcfcd

Observation 8a491032-55db-4aa9-8f3f-b0b755e49a0d · outbound

This paper cites Swe-bench: Can language models resolve real-world github issues? In The twelfth international conference on learning representations, 2023.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Swe-bench: Can language models resolve real-world github issues? In The twelfth international conference on learning representations, 2023

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.836535Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.836535Z digest=sha256:25b3fe9fa15abd523c0b938db16897f02a498361bcae9459f767f3c8b6221216

Observation aab7bcd4-4428-4309-883a-25b4b258a4de · outbound

This paper cites Swe-agent: Agent-computer interfaces enable automated software engineering.Advances in Neural Information Processing Systems, 37:50528–50652, 2024.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Swe-agent: Agent-computer interfaces enable automated software engineering.Advances in Neural Information Processing Systems, 37:50528–50652, 2024

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.840164Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.840164Z digest=sha256:dc7762330b19cc69099650865709a05773af5443100f4990963d43bb202c7422

Observation 0f46069f-7c1b-4654-84df-8d5951222a0d · outbound

This paper cites OpenHands: An Open Platform for AI Software Developers as Generalist Agents.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models OpenHands: An Open Platform for AI Software Developers as Generalist Agents

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.844460Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.844460Z digest=sha256:7066c537764f0f21fd4b29e415d17d62fd5f8316b387a1b3ac321e3a5e000bb5

Observation cd4ec506-4b13-428a-944a-5586424a8fdd · outbound

This paper cites GPT-4 Technical Report.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models GPT-4 Technical Report

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.849338Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.849338Z digest=sha256:a23abea7a7e22f9330623ee143e163d5be3a18815bc879b512aabaee70b6317b

Observation 0244c97d-84c3-426d-b3c0-5cac0892ee80 · outbound

This paper cites Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.853614Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.853614Z digest=sha256:b1c868fca0c56282238892fd4a5e8746c680f46aa5d5004dea93db6e74b3d05f

Observation cbd3c701-2e96-4d91-a28f-00fa08833227 · outbound

This paper cites Qwen3-VL Technical Report.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Qwen3-VL Technical Report

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.857250Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.857250Z digest=sha256:3415c1b0ec84db886a94d4f1c5aa09da936bf03781772200f397c665e67fc834

Observation 49f5f19b-2114-465f-b9f8-0c06d8428758 · outbound

This paper cites Manning, and Chelsea Finn.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Manning, and Chelsea Finn

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.860774Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.860774Z digest=sha256:66e8983088021698b184978fd354b2c88dab1baed4e8039d5caf7958cef77288

Observation b0ec75f3-7a02-4059-91b8-766d49da58c8 · outbound

This paper cites an unresolved cited work.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Unresolved cited work

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.864231Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.864231Z digest=sha256:7f75151a7daf85607812bdd8d40630ca7bbf70766a4c5e6e5343b7885fec0751

Observation 9bae433f-b067-4f58-be23-2d5f145d7305 · outbound

This paper cites RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.868376Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.868376Z digest=sha256:7a0dfbbc19245805beef260c07101e5ebf28f46a57fc21ea2b00551f58c484c1

Observation 24d777e0-76c9-4ab5-85bd-eae9eff9b2a4 · outbound

This paper cites Alpacaeval: An automatic evaluator of instruction-following models, 2023.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Alpacaeval: An automatic evaluator of instruction-following models, 2023

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.872649Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.872649Z digest=sha256:a03453fa4bb368ce07af22415c90f42297b15965a9025b71d071769fdfa64580

Observation 6fb073d5-c527-4045-a412-cf0a26b973ef · outbound

This paper cites Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.876058Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.876058Z digest=sha256:1c60c2919240ad570439ac9490c398ba483ea7d8f479f71ca289203a2b6564d6

Observation 2c9bbe76-1df1-4aef-ae18-83594b368b6d · outbound

This paper cites Trustjudge: Inconsistencies of LLM-as-a-judge and how to alleviate them.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Trustjudge: Inconsistencies of LLM-as-a-judge and how to alleviate them

Reference 26

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.413092Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-14T04:40:11.879873Z digest=sha256:542ee3f9d0a2b7ddac2d811bdbb44b69dcd063ca47ee64640fbdc1345f5f16db

Observation 95d835a8-80d7-4953-a92f-9aba5429a9ae · outbound

This paper cites OpenAI GPT-5 System Card.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models OpenAI GPT-5 System Card

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.883152Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.883152Z digest=sha256:c4818bcd8e56a1549a635a43013bf2872cac392a462452ef937baafbceb008ce

Observation 3d3d6085-8313-4b13-a5d8-55ee0111d7e2 · outbound

This paper cites Pai-bench: A comprehensive benchmark for physical ai.arXiv preprint arXiv:2512.01989, 2025.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Pai-bench: A comprehensive benchmark for physical ai.arXiv preprint arXiv:2512.01989, 2025

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.886678Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.886678Z digest=sha256:8e694612721bdc9f5f5ad1b6ee6d3385995815959fd960419d842bd993f8a044

Observation 567042e8-a546-4d6a-9c96-f9deddd1aa5c · outbound

This paper cites Llava-onevision: Easy visual task transfer.Transactions on Machine Learning Research.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Llava-onevision: Easy visual task transfer.Transactions on Machine Learning Research

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.400689Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-14T04:40:11.890054Z digest=sha256:e276fde96dab6f2ffc859f56964ec8c274d1633bcf3b5b1f12b7b1d965c60741

Observation aa3b390b-492d-4fd5-967a-aeddbd515426 · outbound

This paper cites Xing, Hao Zhang, Joseph E.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Xing, Hao Zhang, Joseph E

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.893585Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.893585Z digest=sha256:e37ac09e4c285b595d695befcbc4d2785d62c82c35a451b4882b6bc166ea4860

Observation 1a132033-3cb5-484d-8f74-39ce15a92cb4 · outbound

This paper cites Prometheus-vision: Vision-language model as a judge for fine-grained evaluation.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Prometheus-vision: Vision-language model as a judge for fine-grained evaluation

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.896957Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.896957Z digest=sha256:156bbff2356d2207dd9f20db33da5721bf8d042d6227808344d15a163c84d867

Observation 0358f445-0b76-4706-ad16-d7655157e7d1 · outbound

This paper cites MLLM-as-a-Judge: Assessing multimodal LLM-as-a-Judge with vision-language benchmark.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models MLLM-as-a-Judge: Assessing multimodal LLM-as-a-Judge with vision-language benchmark

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.373460Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-14T04:40:11.900443Z digest=sha256:c85563a1040411c8890c59e13cb9845c9c212f877ef5405374b954cd7b5ff577

Observation 2c624792-f540-4523-b288-24a52e8861ae · outbound

This paper cites Llava-critic: Learning to evaluate multimodal models.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Llava-critic: Learning to evaluate multimodal models

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.903918Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.903918Z digest=sha256:008f112c524de09f90cefc3ec6bf3678ce966ab84980221bc9a20bde807dfd30

Observation e25d5e47-2cdd-4167-bc22-087b125ba711 · outbound

This paper cites Generative Reward Models.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Generative Reward Models

Reference 34

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.908413Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.908413Z digest=sha256:9dd472c23c02af644927a77c412f11a6a53980fd46be11b119c05a4b9ab471d7

Observation be7c3ea8-06e3-45d4-a8a0-e9b0d15f2db7 · outbound

This paper cites CompassJudger-1: All-in-one Judge Model Helps Model Evaluation and Evolution.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models CompassJudger-1: All-in-one Judge Model Helps Model Evaluation and Evolution

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.912277Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.912277Z digest=sha256:403db60a4351efa5aa7005b4eb3ffcf67b95a86c9bb0588b94761b2ad03e7aed

Observation 82c510b3-bbc4-4023-8563-b5d3aeec15a6 · outbound

This paper cites Vision- language models are zero-shot reward models for reinforcement learning.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Vision- language models are zero-shot reward models for reinforcement learning

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.355874Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-14T04:40:11.916450Z digest=sha256:d70daf9b1ba9eb6be67dcd6ea84ca5c71d4eabc2bec2de0b6c6672ce6ceb8388

Observation d15df90e-4803-44d6-92a7-80e66e763c95 · outbound

This paper cites Rl-vlm-f: reinforcement learning from vision language foundation model feedback.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Rl-vlm-f: reinforcement learning from vision language foundation model feedback

Reference 37

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.342809Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-14T04:40:11.920048Z digest=sha256:1bf10674bdc8069f4e63a70418399734a02087439bb35a3ff4bbfb8c885b6086

Observation 0884635c-e168-4f7e-8c97-f4efbcac098c · outbound

This paper cites Vision-Language Models as a Source of Rewards.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Vision-Language Models as a Source of Rewards

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.923452Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.923452Z digest=sha256:161dc12a3789c236b7209a8b9ef6ec08c342c056ddd310d769bf8ef4d429d980

Observation e6b023bb-0e25-414a-9ac6-145d4b8800f1 · outbound

This paper cites VisionReward: Fine-grained multi-dimensional human preference learning for image and video generation.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models VisionReward: Fine-grained multi-dimensional human preference learning for image and video generation

Reference 39

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.329036Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-14T04:40:11.927270Z digest=sha256:5c99d9952fbbe99b451c50e8dd4fb30acc66dd24b014103c4994606810d07854

Observation 2ed783aa-f9e8-42c0-9c80-2013255c69df · outbound

This paper cites Improving video generation with human feedback.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Improving video generation with human feedback

Reference 40

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.315099Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-14T04:40:11.930706Z digest=sha256:43fc4d552577f3c0ec53ecd4087f09e0b36df0bbe592a4c06db590daed38c970

Observation aa38349e-b5d5-4685-97c6-03eaab10ba6b · outbound

This paper cites RewardBench: Evaluating Reward Models for Language Modeling.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models RewardBench: Evaluating Reward Models for Language Modeling

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.934216Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.934216Z digest=sha256:aa78737882c06cc20af5c42b4f26b17a359367fdef460f7bdcca731ea428d0ad

Observation 9be46e54-4553-46b7-9318-4825b8aaabbb · outbound

This paper cites Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models

Reference 42

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.938227Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.938227Z digest=sha256:5cf358959d13ac97c5bbb83db3cd4a378df13e3081789b61a1b94861ae8371f4

Observation 04a0d552-7e46-4fe0-8ec3-db08307b25d3 · outbound

This paper cites Vl-rewardbench: a challenging benchmark for vision-language generative reward models.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Vl-rewardbench: a challenging benchmark for vision-language generative reward models

Reference 43

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.941977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.941977Z digest=sha256:2d7b4fbc3d3c5117cf77961770129343eda5006bd6dad0c0a9b7df68143956d2

Observation e0a2c348-bf0c-4fa1-a269-d6549e76e10b · outbound

This paper cites Simpo: Simple preference optimization with a reference-free reward.Advances in Neural Information Processing Systems, 37:124198–124235, 2024.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Simpo: Simple preference optimization with a reference-free reward.Advances in Neural Information Processing Systems, 37:124198–124235, 2024

Reference 44

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.945910Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.945910Z digest=sha256:b306bc946965f0e843e483e7044b5a1b9b75701c23e65f875a9c55d441ba1d5c

Observation 33621821-7d61-40bb-ab70-e5d5e7c53fb5 · outbound

This paper cites Aligning with human judgement: The role of pairwise preference in large language model evaluators.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Aligning with human judgement: The role of pairwise preference in large language model evaluators

Reference 45

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.289737Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-14T04:40:11.949377Z digest=sha256:6bdcea728e8819bb4e42a016ecad03b508217b006e39f36f7ad5fb66f3733623

Observation 85df1f86-a21a-437e-95d8-6f8232afdfb2 · outbound

This paper cites Constitutional AI: Harmlessness from AI Feedback.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Constitutional AI: Harmlessness from AI Feedback

Reference 46

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.953577Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.953577Z digest=sha256:d4745f59a338031ed15dc080e00170207e34491020d17ee2b8a82054086eed45

Observation 1d27a4f9-312c-4712-b3c9-eb31e566a8ad · outbound

This paper cites Meta-rewarding language models: Self-improving alignment with llm-as-a-meta-judge.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Meta-rewarding language models: Self-improving alignment with llm-as-a-meta-judge

Reference 47

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.957080Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.957080Z digest=sha256:3724f96a363e8f6caca2b687c73b6c1515c5016ab20afbeee4401cb270fe3a5c

Observation 1f9e4c15-1c26-4f84-8480-61c12bb86da4 · outbound

This paper cites An empirical distribution function for sampling with incomplete information.The annals of mathematical statistics, pages 641–647, 1955.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models An empirical distribution function for sampling with incomplete information.The annals of mathematical statistics, pages 641–647, 1955

Reference 48

Resolution
verified fuzzy
raw_fallback, observed 2026-08-14T04:40:12.271486Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.

source=pdf_text observed=2026-08-14T04:40:11.960523Z digest=sha256:3e5d7c9f1c6a3bb660339cd696134f071dede4cdb6cf10fcb32ab7ef347dc0dc

Observation 6daa94cf-372b-4674-9224-44b2b1c4959a · outbound

This paper cites Finetuned language models are zero-shot learners.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Finetuned language models are zero-shot learners

Reference 49

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.964323Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.964323Z digest=sha256:974690bfb4e2b81d8212fae77a8bfdaffc8a9abc31a82a55348b7833cce876fd

Observation 5c570ab1-c0c9-4ba6-85ed-58cc0c1e2242 · outbound

This paper cites Swift: a scalable lightweight infrastructure for fine-tuning.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Swift: a scalable lightweight infrastructure for fine-tuning

Reference 50

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.968028Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.968028Z digest=sha256:3c8c944e40b813af852c6d62c40c8b457538c3f0a22add213361f03a6abed434

Observation 49b5de5b-6a5f-423a-bddb-39e2d77891dc · outbound

This paper cites Hybridflow: A flexible and efficient rlhf framework.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models Hybridflow: A flexible and efficient rlhf framework

Reference 51

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.971503Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.971503Z digest=sha256:04cc81c644593822526842fec0bb7fdb1510aef386bc125d361b83215162532e

Observation 5231abc1-8303-491c-bc12-84ef2fe769e3 · outbound

This paper cites World Simulation with Video Foundation Models for Physical AI.

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models World Simulation with Video Foundation Models for Physical AI

Reference 52

Resolution
unresolved
no resolver link, observed 2026-08-14T04:40:11.975172Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-14T04:40:11.975172Z digest=sha256:712cee572fa8fe3352b92377274e7243b212b12156d79e6d9c76259f81d7b9d5

Pith citing papers

No inbound Pith citation observations are available.