{"as_of":"2026-08-15T23:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d42e32ee4a5b1d65504be725254f276b8b9cc545bf3def4be8dc9fd3317a215d","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:40:11.975172Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08491/citation-record","integrity":"/paper/2608.08491/integrity","json":"/paper/2608.08491/citation-record.json","paper":"/paper/2608.08491"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.583426Z","title":"Eureka: Human-level reward design via coding large language models","venue":null,"work_id":"22ee6e5d-92eb-4b4f-8df8-a6746bc3ea14","year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.779147Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:3441ae7719e02e950abe849d6f38ee819c744d45dc268719262ef8c7d4eec30d","observation_id":"e0d22af6-881a-40a9-ad56-cfcaa581314c","resolution":{"observed_at":"2026-08-14T04:40:12.587619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.784324Z","title":"Serl: A software suite for sample- efficient robotic reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.784324Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:f45d019969c7e7bb8f29bc9f03f0b9165e92263ef2ff9b28c53e69e5f8d2c007","observation_id":"e5ab305d-2dae-49b4-8184-b6bda825693b","resolution":{"observed_at":"2026-08-14T04:40:11.784324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.788149Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.788149Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:4d37cd33e39a5c0e90e977135a2352c3ce2dd07bd7cbc21767d735deaccb1221","observation_id":"62a73c9e-3392-40cf-a88e-febe6f022191","resolution":{"observed_at":"2026-08-14T04:40:11.788149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.792711Z","title":"Improving vision-language-action model with online reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.792711Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:349c4e65a4611eb0a84f1b2c8a42688a3d2649b4fc45da7ed4b370aefaf3fdae","observation_id":"2e38b2f5-f651-47ad-923c-a4f7d76c52ea","resolution":{"observed_at":"2026-08-14T04:40:11.792711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.549594Z","title":"Robot-r1: Reinforcement learning for enhanced embodied reasoning in robotics","venue":null,"work_id":"d8d70c73-b10b-49e5-b3a7-d96302fef772","year":null},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.796781Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:86606be93ee5b9e167fcbc67d4b415cb404e6256c6896a0eb394b93d1ccaca59","observation_id":"769055bf-55da-4452-90ad-e1cce2da1523","resolution":{"observed_at":"2026-08-14T04:40:12.554576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.537607Z","title":"Reinforcement learning with foundation priors: Let embodied agent efficiently learn on its own","venue":null,"work_id":"89a167b9-8372-4f49-8980-9bb9de18a0f3","year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.800620Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:46016514ce2ecf20509851f6b7904d86e994e7fc5bd67a4fea5083ef0818ff7e","observation_id":"9ca47e5f-3f36-4b14-8605-de65615983c1","resolution":{"observed_at":"2026-08-14T04:40:12.541917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.525702Z","title":"Self-improving embodied foundation models","venue":null,"work_id":"b1e0a8c5-02e5-4f80-af6e-94c1359e69a9","year":null},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.804984Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:23d95cbaadf6f76df1510cd95c5720344c0500bbc4f70eabee8c60687ab406cf","observation_id":"30d88430-1e91-41cd-822f-e86ab0170b9f","resolution":{"observed_at":"2026-08-14T04:40:12.529740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.809335Z","title":"Deep reinforcement learning from human preferences.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.809335Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:17399e7348f79800df9aa05d9ef77374a4e072bcdd42603372fe37e8f5ef3067","observation_id":"d9f4bd21-72a3-4fa7-9909-efd9b3646c86","resolution":{"observed_at":"2026-08-14T04:40:11.809335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.504992Z","title":"Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, et al","venue":null,"work_id":"a7628821-a221-4afb-b0e5-061da15c5270","year":2022},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.813385Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:5d6511cbb62ce6a3d90317413cb4d8555a6ba496eded318219e0c03383dd0c29","observation_id":"ee2fe596-3c97-4093-a37c-1e5df48ade05","resolution":{"observed_at":"2026-08-14T04:40:12.510106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.817154Z","title":"Roboreward: General-purpose vision-language reward models for robotics.arXiv preprint arXiv:2601.00675, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.817154Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:a53fc8a5875b1ec2d0a3116b52521bb3611131d34e751e8ebf4e1f5cc212bbec","observation_id":"6d2e1e5f-42ba-49b0-9dfc-961bd938fc13","resolution":{"observed_at":"2026-08-14T04:40:11.817154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-14T04:40:11.820969Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.820969Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:e80bd024953bfd0b2cc2d4996b2810f32520eb18f5795d1a99c52b5f8ecb4970","observation_id":"c6ced9ac-b537-47b1-b6e7-e1ea237941f2","resolution":{"observed_at":"2026-08-14T04:40:11.820969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.493264Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv e-prints, pages arXiv–2501, 2025","venue":null,"work_id":"0ce51d14-edce-4e3a-83cf-d646bdfa1d7b","year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.824989Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:a7dc3bba54f58b60e1ba2b1728ae56a24f349ceaddb0d61639dc45514801494d","observation_id":"5e30c658-ab9d-462b-9014-8f3557ebefcc","resolution":{"observed_at":"2026-08-14T04:40:12.497747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.481632Z","title":"rstar-math: Small llms can master math reasoning with self-evolved deep thinking","venue":null,"work_id":"b7268dc8-f5f5-4774-a425-9bd47311ffed","year":null},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.828550Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:196d376d13ee3164d4abdefaab3e60464fc1895b1044baf6d60951ca12e38afe","observation_id":"c4470bf2-8fcc-4120-8bdb-1f8db33533c1","resolution":{"observed_at":"2026-08-14T04:40:12.485788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.469513Z","title":"Training software engineering agents and verifiers with swe-gym","venue":null,"work_id":"13398cff-0c0c-4d98-97c8-eb77190d40b5","year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.832736Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:263bb3aabfc66da9063413def1b51a78a6b649440bf2d7daee3cf6c3eb2dcfcd","observation_id":"1cddd270-4b8e-4d7d-9528-9d61ca4b08e2","resolution":{"observed_at":"2026-08-14T04:40:12.474431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.836535Z","title":"Swe-bench: Can language models resolve real-world github issues? In The twelfth international conference on learning representations, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.836535Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:25b3fe9fa15abd523c0b938db16897f02a498361bcae9459f767f3c8b6221216","observation_id":"8a491032-55db-4aa9-8f3f-b0b755e49a0d","resolution":{"observed_at":"2026-08-14T04:40:11.836535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.840164Z","title":"Swe-agent: Agent-computer interfaces enable automated software engineering.Advances in Neural Information Processing Systems, 37:50528–50652, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.840164Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:dc7762330b19cc69099650865709a05773af5443100f4990963d43bb202c7422","observation_id":"aab7bcd4-4428-4309-883a-25b4b258a4de","resolution":{"observed_at":"2026-08-14T04:40:11.840164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16741","last_updated":"2025-04-18T18:14:31Z","snapshot_observed_at":"2026-08-14T17:59:52.524740Z","submitted_at":"2024-07-23T17:50:43Z","title":"OpenHands: An Open Platform for AI Software Developers as Generalist Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16741","snapshot_observed_at":"2026-08-14T04:40:11.844460Z","title":"Openhands: An open platform for ai software developers as generalist agents.arXiv preprint arXiv:2407.16741, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.844460Z"},"links":{"cited_paper":"/paper/2407.16741","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:7066c537764f0f21fd4b29e415d17d62fd5f8316b387a1b3ac321e3a5e000bb5","observation_id":"0f46069f-7c1b-4654-84df-8d5951222a0d","resolution":{"observed_at":"2026-08-14T04:40:11.844460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-14T04:40:11.849338Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.849338Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:a23abea7a7e22f9330623ee143e163d5be3a18815bc879b512aabaee70b6317b","observation_id":"cd4ec506-4b13-428a-944a-5586424a8fdd","resolution":{"observed_at":"2026-08-14T04:40:11.849338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.853614Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.853614Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:b1c868fca0c56282238892fd4a5e8746c680f46aa5d5004dea93db6e74b3d05f","observation_id":"0244c97d-84c3-426d-b3c0-5cac0892ee80","resolution":{"observed_at":"2026-08-14T04:40:11.853614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-14T04:40:11.857250Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.857250Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:3415c1b0ec84db886a94d4f1c5aa09da936bf03781772200f397c665e67fc834","observation_id":"cbd3c701-2e96-4d91-a28f-00fa08833227","resolution":{"observed_at":"2026-08-14T04:40:11.857250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.860774Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.860774Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:66e8983088021698b184978fd354b2c88dab1baed4e8039d5caf7958cef77288","observation_id":"49f5f19b-2114-465f-b9f8-0c06d8428758","resolution":{"observed_at":"2026-08-14T04:40:11.860774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.864231Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.864231Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:7f75151a7daf85607812bdd8d40630ca7bbf70766a4c5e6e5343b7885fec0751","observation_id":"b0ec75f3-7a02-4059-91b8-766d49da58c8","resolution":{"observed_at":"2026-08-14T04:40:11.864231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-08-15T10:07:24.540946Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-14T04:40:11.868376Z","title":"RLAIF vs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.868376Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:7a0dfbbc19245805beef260c07101e5ebf28f46a57fc21ea2b00551f58c484c1","observation_id":"9bae433f-b067-4f58-be23-2d5f145d7305","resolution":{"observed_at":"2026-08-14T04:40:11.868376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.872649Z","title":"Alpacaeval: An automatic evaluator of instruction-following models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.872649Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:a03453fa4bb368ce07af22415c90f42297b15965a9025b71d071769fdfa64580","observation_id":"24d777e0-76c9-4ab5-85bd-eae9eff9b2a4","resolution":{"observed_at":"2026-08-14T04:40:11.872649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-14T04:40:11.876058Z","title":"Chatbot arena: An open platform for evaluating llms by human preference.arXiv preprint arXiv:2403.04132, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.876058Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:1c60c2919240ad570439ac9490c398ba483ea7d8f479f71ca289203a2b6564d6","observation_id":"6fb073d5-c527-4045-a412-cf0a26b973ef","resolution":{"observed_at":"2026-08-14T04:40:11.876058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.408972Z","title":"Trustjudge: Inconsistencies of LLM-as-a-judge and how to alleviate them","venue":null,"work_id":"b69b831a-7972-42c9-8c7c-bb350fb0c64b","year":2026},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.879873Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:542ee3f9d0a2b7ddac2d811bdbb44b69dcd063ca47ee64640fbdc1345f5f16db","observation_id":"2c9bbe76-1df1-4aef-ae18-83594b368b6d","resolution":{"observed_at":"2026-08-14T04:40:12.413092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-14T04:40:11.883152Z","title":"Openai gpt-5 system card.arXiv preprint arXiv:2601.03267, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.883152Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:c4818bcd8e56a1549a635a43013bf2872cac392a462452ef937baafbceb008ce","observation_id":"95d835a8-80d7-4953-a92f-9aba5429a9ae","resolution":{"observed_at":"2026-08-14T04:40:11.883152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.886678Z","title":"Pai-bench: A comprehensive benchmark for physical ai.arXiv preprint arXiv:2512.01989, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.886678Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:8e694612721bdc9f5f5ad1b6ee6d3385995815959fd960419d842bd993f8a044","observation_id":"3d3d6085-8313-4b13-a5d8-55ee0111d7e2","resolution":{"observed_at":"2026-08-14T04:40:11.886678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.396072Z","title":"Llava-onevision: Easy visual task transfer.Transactions on Machine Learning Research","venue":null,"work_id":"17b77895-f94f-4515-ab24-ca5288642ed6","year":null},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.890054Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:e276fde96dab6f2ffc859f56964ec8c274d1633bcf3b5b1f12b7b1d965c60741","observation_id":"567042e8-a546-4d6a-9c96-f9deddd1aa5c","resolution":{"observed_at":"2026-08-14T04:40:12.400689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.893585Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.893585Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:e37ac09e4c285b595d695befcbc4d2785d62c82c35a451b4882b6bc166ea4860","observation_id":"aa3b390b-492d-4fd5-967a-aeddbd515426","resolution":{"observed_at":"2026-08-14T04:40:11.893585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.896957Z","title":"Prometheus-vision: Vision-language model as a judge for fine-grained evaluation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.896957Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:156bbff2356d2207dd9f20db33da5721bf8d042d6227808344d15a163c84d867","observation_id":"1a132033-3cb5-484d-8f74-39ce15a92cb4","resolution":{"observed_at":"2026-08-14T04:40:11.896957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.369690Z","title":"MLLM-as-a-Judge: Assessing multimodal LLM-as-a-Judge with vision-language benchmark","venue":null,"work_id":"f08fdce4-bd2b-4d12-85b3-e84987de3b52","year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.900443Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:c85563a1040411c8890c59e13cb9845c9c212f877ef5405374b954cd7b5ff577","observation_id":"0358f445-0b76-4706-ad16-d7655157e7d1","resolution":{"observed_at":"2026-08-14T04:40:12.373460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.903918Z","title":"Llava-critic: Learning to evaluate multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.903918Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:008f112c524de09f90cefc3ec6bf3678ce966ab84980221bc9a20bde807dfd30","observation_id":"2c624792-f540-4523-b288-24a52e8861ae","resolution":{"observed_at":"2026-08-14T04:40:11.903918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-12T22:32:17.121578Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-08-14T04:40:11.908413Z","title":"Generative reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.908413Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:9dd472c23c02af644927a77c412f11a6a53980fd46be11b119c05a4b9ab471d7","observation_id":"e25d5e47-2cdd-4167-bc22-087b125ba711","resolution":{"observed_at":"2026-08-14T04:40:11.908413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16256","last_updated":"2024-10-21T17:56:51Z","snapshot_observed_at":"2026-08-15T04:20:25.578973Z","submitted_at":"2024-10-21T17:56:51Z","title":"CompassJudger-1: All-in-one Judge Model Helps Model Evaluation and Evolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16256","snapshot_observed_at":"2026-08-14T04:40:11.912277Z","title":"CompassJudger-1: All-in-one judge model helps model evaluation and evolution.arXiv preprint arXiv:2410.16256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.912277Z"},"links":{"cited_paper":"/paper/2410.16256","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:403db60a4351efa5aa7005b4eb3ffcf67b95a86c9bb0588b94761b2ad03e7aed","observation_id":"be7c3ea8-06e3-45d4-a8a0-e9b0d15f2db7","resolution":{"observed_at":"2026-08-14T04:40:11.912277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.351531Z","title":"Vision- language models are zero-shot reward models for reinforcement learning","venue":null,"work_id":"a830c4a4-5860-44c4-b6f0-de7d0dd91981","year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.916450Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:d70daf9b1ba9eb6be67dcd6ea84ca5c71d4eabc2bec2de0b6c6672ce6ceb8388","observation_id":"82c510b3-bbc4-4023-8563-b5d3aeec15a6","resolution":{"observed_at":"2026-08-14T04:40:12.355874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.338155Z","title":"Rl-vlm-f: reinforcement learning from vision language foundation model feedback","venue":null,"work_id":"5244d76e-4f39-4a1b-bba5-6fc73cec2f20","year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.920048Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:1bf10674bdc8069f4e63a70418399734a02087439bb35a3ff4bbfb8c885b6086","observation_id":"d15df90e-4803-44d6-92a7-80e66e763c95","resolution":{"observed_at":"2026-08-14T04:40:12.342809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09187","last_updated":"2024-07-12T21:14:32Z","snapshot_observed_at":"2026-08-13T14:21:04.495579Z","submitted_at":"2023-12-14T18:06:17Z","title":"Vision-Language Models as a Source of Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09187","snapshot_observed_at":"2026-08-14T04:40:11.923452Z","title":"Vision- language models as a source of rewards.arXiv preprint arXiv:2312.09187, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.923452Z"},"links":{"cited_paper":"/paper/2312.09187","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:161dc12a3789c236b7209a8b9ef6ec08c342c056ddd310d769bf8ef4d429d980","observation_id":"0884635c-e168-4f7e-8c97-f4efbcac098c","resolution":{"observed_at":"2026-08-14T04:40:11.923452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.323654Z","title":"VisionReward: Fine-grained multi-dimensional human preference learning for image and video generation","venue":null,"work_id":"10f93633-8f84-4ba3-94cf-68db829113cb","year":2026},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.927270Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:5c99d9952fbbe99b451c50e8dd4fb30acc66dd24b014103c4994606810d07854","observation_id":"e6b023bb-0e25-414a-9ac6-145d4b8800f1","resolution":{"observed_at":"2026-08-14T04:40:12.329036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.310883Z","title":"Improving video generation with human feedback","venue":null,"work_id":"978ae855-1237-4ecc-b7ab-4d1ddfee97f8","year":null},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.930706Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:43fc4d552577f3c0ec53ecd4087f09e0b36df0bbe592a4c06db590daed38c970","observation_id":"2ed783aa-f9e8-42c0-9c80-2013255c69df","resolution":{"observed_at":"2026-08-14T04:40:12.315099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-15T03:01:41.971978Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-14T04:40:11.934216Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.934216Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:aa78737882c06cc20af5c42b4f26b17a359367fdef460f7bdcca731ea428d0ad","observation_id":"aa38349e-b5d5-4685-97c6-03eaab10ba6b","resolution":{"observed_at":"2026-08-14T04:40:11.934216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14191","last_updated":"2025-02-20T01:48:13Z","snapshot_observed_at":"2026-08-07T18:03:15.507750Z","submitted_at":"2025-02-20T01:48:13Z","title":"Multimodal RewardBench: Holistic Evaluation of Reward Models for Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14191","snapshot_observed_at":"2026-08-14T04:40:11.938227Z","title":"Multimodal reward- bench: Holistic evaluation of reward models for vision language models.arXiv preprint arXiv:2502.14191, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.938227Z"},"links":{"cited_paper":"/paper/2502.14191","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:5cf358959d13ac97c5bbb83db3cd4a378df13e3081789b61a1b94861ae8371f4","observation_id":"9be46e54-4553-46b7-9318-4825b8aaabbb","resolution":{"observed_at":"2026-08-14T04:40:11.938227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.941977Z","title":"Vl-rewardbench: a challenging benchmark for vision-language generative reward models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.941977Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:2d7b4fbc3d3c5117cf77961770129343eda5006bd6dad0c0a9b7df68143956d2","observation_id":"04a0d552-7e46-4fe0-8ec3-db08307b25d3","resolution":{"observed_at":"2026-08-14T04:40:11.941977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.945910Z","title":"Simpo: Simple preference optimization with a reference-free reward.Advances in Neural Information Processing Systems, 37:124198–124235, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.945910Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:b306bc946965f0e843e483e7044b5a1b9b75701c23e65f875a9c55d441ba1d5c","observation_id":"e0a2c348-bf0c-4fa1-a269-d6549e76e10b","resolution":{"observed_at":"2026-08-14T04:40:11.945910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.285318Z","title":"Aligning with human judgement: The role of pairwise preference in large language model evaluators","venue":null,"work_id":"13cc9d03-910c-4610-8761-154b771eeda8","year":null},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.949377Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:6bdcea728e8819bb4e42a016ecad03b508217b006e39f36f7ad5fb66f3733623","observation_id":"33621821-7d61-40bb-ab70-e5d5e7c53fb5","resolution":{"observed_at":"2026-08-14T04:40:12.289737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-14T04:40:11.953577Z","title":"Constitutional ai: Harmlessness from ai feedback.arXiv preprint arXiv:2212.08073, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.953577Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:d4745f59a338031ed15dc080e00170207e34491020d17ee2b8a82054086eed45","observation_id":"85df1f86-a21a-437e-95d8-6f8232afdfb2","resolution":{"observed_at":"2026-08-14T04:40:11.953577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.957080Z","title":"Meta-rewarding language models: Self-improving alignment with llm-as-a-meta-judge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.957080Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:3724f96a363e8f6caca2b687c73b6c1515c5016ab20afbeee4401cb270fe3a5c","observation_id":"1d27a4f9-312c-4712-b3c9-eb31e566a8ad","resolution":{"observed_at":"2026-08-14T04:40:11.957080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:12.266043Z","title":"An empirical distribution function for sampling with incomplete information.The annals of mathematical statistics, pages 641–647, 1955","venue":null,"work_id":"e7611777-3ea8-4fc4-a423-421a5965cf58","year":1955},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.960523Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:3e5d7c9f1c6a3bb660339cd696134f071dede4cdb6cf10fcb32ab7ef347dc0dc","observation_id":"1f9e4c15-1c26-4f84-8480-61c12bb86da4","resolution":{"observed_at":"2026-08-14T04:40:12.271486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.964323Z","title":"Finetuned language models are zero-shot learners","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.964323Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:974690bfb4e2b81d8212fae77a8bfdaffc8a9abc31a82a55348b7833cce876fd","observation_id":"6daa94cf-372b-4674-9224-44b2b1c4959a","resolution":{"observed_at":"2026-08-14T04:40:11.964323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.968028Z","title":"Swift: a scalable lightweight infrastructure for fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.968028Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:3c8c944e40b813af852c6d62c40c8b457538c3f0a22add213361f03a6abed434","observation_id":"5c570ab1-c0c9-4ba6-85ed-58cc0c1e2242","resolution":{"observed_at":"2026-08-14T04:40:11.968028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:40:11.971503Z","title":"Hybridflow: A flexible and efficient rlhf framework","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.971503Z"},"links":{"citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:04cc81c644593822526842fec0bb7fdb1510aef386bc125d361b83215162532e","observation_id":"49b5de5b-6a5f-423a-bddb-39e2d77891dc","resolution":{"observed_at":"2026-08-14T04:40:11.971503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00062","snapshot_observed_at":"2026-08-14T04:40:11.975172Z","title":"Pick up the yellow cup","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T04:40:11.975172Z"},"links":{"cited_paper":"/paper/2511.00062","citing_paper":"/paper/2608.08491"},"observation_digest":"sha256:712cee572fa8fe3352b92377274e7243b212b12156d79e6d9c76259f81d7b9d5","observation_id":"5231abc1-8303-491c-bc12-84ef2fe769e3","resolution":{"observed_at":"2026-08-14T04:40:11.975172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08491","last_updated":"2026-08-09T05:25:22Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T08:24:13.828207Z","submitted_at":"2026-08-09T05:25:22Z","title":"TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2608.08491."}