Pith. sign in

Paper Citation Record · LEDGER

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning

As of 11 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2502.03717.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2502.03717 v2

Coverage vector

measured 41 of 41 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-09T01:04:04.161124Z

measured 41 of 41 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-11T06:34:44.6726+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

41 of 41 outbound references displayed

  • verified exact1
  • verified fuzzy13
  • unresolved27
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 9862a8bb-a89c-4762-90ec-f217dcae7027 · outbound

This paper cites Walk these ways: Tuning robot control for generalization with multiplicity of behavior,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Walk these ways: Tuning robot control for generalization with multiplicity of behavior,

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.058228Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.058228Z digest=sha256:55532cb6854d46c501c2b0f6b944e16cf1f0a2a697550d4f15b4f1cb116a7ed9

Observation 27d7851e-e09c-4253-8ab9-8c60dbdf1b89 · outbound

This paper cites RMA: Rapid Motor Adaptation for Legged Robots.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning RMA: Rapid Motor Adaptation for Legged Robots

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.061490Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.061490Z digest=sha256:934d7f9be33af8e53757a34ee1029187ff84fc56256fd50f6fe69f6d8c8bc9dc

Observation 060ce7d0-de42-43e0-be15-115deb11a287 · outbound

This paper cites Learning quadrupedal locomotion over challenging terrain,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Learning quadrupedal locomotion over challenging terrain,

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.064526Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.064526Z digest=sha256:8d25cca7361b8b3721606813c9b127e30405dbb71b75e83682363a6ab8da2079

Observation 2de40d92-583b-412d-805c-9cd47179d2d4 · outbound

This paper cites Inverse reward design,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Inverse reward design,

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.067042Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.067042Z digest=sha256:a4f0d7641aec0f0b7938a1651a7849ae5657f83c42b746112d36eac4fccb4d7c

Observation 4837da17-58ba-4590-bce9-46fbd5cafc6c · outbound

This paper cites Reward Design with Language Models.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Reward Design with Language Models

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.069804Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.069804Z digest=sha256:80a6aec85765802312f268361859894f72eb1c4cbeb3134c8104be8875f15fa3

Observation 64b65b33-7600-4aa1-b7b9-cf8a7245ee5a · outbound

This paper cites Language to Rewards for Robotic Skill Synthesis.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Language to Rewards for Robotic Skill Synthesis

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.072614Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.072614Z digest=sha256:bab4c6a9fcdd8f393cd6441d46f0250946d9d1a8e20d76bbc765bd55cf0c7b04

Observation d771b9c7-bfe8-4072-9f82-70ce3b44ccde · outbound

This paper cites SayTap: Language to Quadrupedal Locomotion.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning SayTap: Language to Quadrupedal Locomotion

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.075537Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.075537Z digest=sha256:d5dd3ce7b1237a83c450b69c5ea90950c2d0f6e91305c85af8011ae061e3c5b9

Observation 6dc50f98-2973-42fb-ac68-accebfe8d797 · outbound

This paper cites Eureka: Human-Level Reward Design via Coding Large Language Models.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Eureka: Human-Level Reward Design via Coding Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.078126Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.078126Z digest=sha256:c9640ddcfe9e4ec2690e02c22a16d60543f007ac0555dd3fdf6f6ab58fd83a5b

Observation 539c8285-fa94-41a4-ab54-15348654d59b · outbound

This paper cites Interactive learning from policy- dependent human feedback,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Interactive learning from policy- dependent human feedback,

Reference 9

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.466325Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-09T01:04:04.080899Z digest=sha256:0c13551b72c7a691900844dad0075a4b2dfd2f31c01b478b536a0789c7645f8c

Observation b0ac61ae-d3c3-4e39-95b7-97d63f2418bf · outbound

This paper cites Deep reinforcement learning from human preferences,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Deep reinforcement learning from human preferences,

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.083359Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.083359Z digest=sha256:6131226755f112706114f24bfd3243c3c1815900ed750a37bf7952de3a3b2608

Observation f5750ba4-345c-479c-b362-073007f18f0d · outbound

This paper cites PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning PEBBLE: Feedback-Efficient Interactive Reinforcement Learning via Relabeling Experience and Unsupervised Pre-training

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.085762Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.085762Z digest=sha256:37dce5067edc7b95b57df10f897adb28ebf3b016bff2e43b38e7e6fb59046718

Observation b1355008-a2f1-4702-bc83-86db8485d1f4 · outbound

This paper cites Few-shot preference learning for human- in-the-loop rl,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Few-shot preference learning for human- in-the-loop rl,

Reference 12

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.453650Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-09T01:04:04.088220Z digest=sha256:2dfbd7711ec3c7d42270c828023f789d4e2e9f40f737e42a0eddb8d5281a6dcb

Observation f9dd4e5d-dff2-4841-aa77-11be2ec4c5b2 · outbound

This paper cites Barkour: Benchmarking Animal-level Agility with Quadruped Robots.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Barkour: Benchmarking Animal-level Agility with Quadruped Robots

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.090671Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.090671Z digest=sha256:19dad3273f32050d86aa4be3b3d12f3d1250f5027e60fbd6938e634858146b38

Observation ae7638f6-b09f-4d7b-9d81-b13095502303 · outbound

This paper cites Minimizing Energy Consumption Leads to the Emergence of Gaits in Legged Robots.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Minimizing Energy Consumption Leads to the Emergence of Gaits in Legged Robots

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.093592Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.093592Z digest=sha256:3f7b56794ae61c7a0380fbfc961e2164f69e93ff1a9330d209475b7a8094b916

Observation 65fc7f5b-293d-440c-aa85-5d35205685b8 · outbound

This paper cites Fast and efficient locomotion via learned gait transitions,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Fast and efficient locomotion via learned gait transitions,

Reference 15

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.445282Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-09T01:04:04.096516Z digest=sha256:22626182003c4b7202b537eadf14e41b13dadd4603fd9eda141e5d1862179725

Observation 24ec8c59-73b2-439e-b7e2-8cffc0b41ec1 · outbound

This paper cites Code as policies: Language model programs for embodied control,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Code as policies: Language model programs for embodied control,

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.099122Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.099122Z digest=sha256:390cbb9720b461b8ffd39b0e8a1a1aeefa07ed51896c40ad405f594b9b4f9138

Observation 21d9a400-f896-46ae-b6a0-0c9723b8bbeb · outbound

This paper cites Do as i can, not as i say: Grounding language in robotic affordances,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Do as i can, not as i say: Grounding language in robotic affordances,

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.101740Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.101740Z digest=sha256:aa6f444de92075a2ae7b668ee7dcd0faa0ba56a1d20b9430b2f623361e064613

Observation 425c8df5-9d11-49ef-a939-9b06610a7654 · outbound

This paper cites Generative expressive robot behaviors using large language models,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Generative expressive robot behaviors using large language models,

Reference 18

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.426709Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-09T01:04:04.104488Z digest=sha256:25b4e315d5452912c6a17c55387d854702a22ce4278a3a409c449825a459c568

Observation 3519c8d9-9308-441f-abba-0962489ea263 · outbound

This paper cites Text2Interaction: Establishing Safe and Preferable Human-Robot Interaction.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Text2Interaction: Establishing Safe and Preferable Human-Robot Interaction

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.107067Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.107067Z digest=sha256:9b564646a719a6b39cd4ed7592883deaf9aae4a1999405b42884baaf4a4cb0f1

Observation c7170756-a754-423d-95b7-0c7413b27345 · outbound

This paper cites Learning to Learn Faster from Human Feedback with Language Model Predictive Control.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Learning to Learn Faster from Human Feedback with Language Model Predictive Control

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.109915Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.109915Z digest=sha256:0bb57beddbb3ced3606cf6591d4bbb211106027ddacaa834558438914f19d6d9

Observation ba02c72b-6728-44ef-8118-682170279fd8 · outbound

This paper cites Language instructed reinforcement learning for human-ai coordination,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Language instructed reinforcement learning for human-ai coordination,

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.418886Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-09T01:04:04.112879Z digest=sha256:74f9214c248cd3cf98295570f9c9bfef96239cd089e4de377917a8150f972bac

Observation 19ba90b6-35f8-4d14-996f-9b0f03fd7e62 · outbound

This paper cites Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.115081Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.115081Z digest=sha256:8fc16f300454fe1143187cdd0c345ab9f0e44eaf26cb32a4111afc02f7e809d9

Observation cfce0453-4214-4ed9-8f30-82ccf5d2a35a · outbound

This paper cites Learning human objectives from sequences of physical corrections,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Learning human objectives from sequences of physical corrections,

Reference 23

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.410955Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-09T01:04:04.117681Z digest=sha256:27d2b4cc570136ca46f66f0519f65adb991e61bf25db638768c3facabd39b8af

Observation d51c9db1-cb4e-458a-b2b7-0072325c16e5 · outbound

This paper cites Interactively shaping agents via human reinforcement: The tamer framework,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Interactively shaping agents via human reinforcement: The tamer framework,

Reference 24

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.402901Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-09T01:04:04.119945Z digest=sha256:e314294112d165605f3b09e44305b61fc2439f12374a4fe17a865a61cee49459

Observation 89db36bf-8add-4e6b-a911-0bbc2542b9d6 · outbound

This paper cites Learning multimodal rewards from rankings,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Learning multimodal rewards from rankings,

Reference 25

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.395402Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-09T01:04:04.122216Z digest=sha256:923ee4156019e31f746b3b2f4854cfeb314fd69cdb9e86ee65ce9d44b07d8457

Observation 2fa5e376-b293-42ee-a8ec-e5ca97fd3662 · outbound

This paper cites Extrapolating beyond suboptimal demonstrations via inverse reinforcement learning from observations,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Extrapolating beyond suboptimal demonstrations via inverse reinforcement learning from observations,

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.124561Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.124561Z digest=sha256:b0cd2aed58290c7fcc9a7422dba0090fe6ac85d2082fb779fa38ede5c9b06a60

Observation c5a44fc6-fb89-4297-93ad-68c6bff49fa4 · outbound

This paper cites Sadigh, A.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Sadigh, A

Reference 27

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.382482Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-09T01:04:04.127091Z digest=sha256:ec199ff8b885f21d0f588ddf9edbda0b15f7cbe327aa5b76ff9e391632d71a54

Observation 940e35dc-0d03-4f4d-9fe6-32276b1a422b · outbound

This paper cites Fine-Tuning Language Models from Human Preferences.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Fine-Tuning Language Models from Human Preferences

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.129314Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.129314Z digest=sha256:4a48458562274d9c2597900086f292c96e9e82a960dfdfef70dfc2a2226a5d8a

Observation 3d1b2b3c-9d17-4128-8b5e-f31e0f16c049 · outbound

This paper cites Preference-conditioned language- guided abstraction,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Preference-conditioned language- guided abstraction,

Reference 29

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.374581Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-09T01:04:04.131784Z digest=sha256:ce430e8a86446e436f249350e219dda58ce07e5bb05287caf168ea1ad8f3048d

Observation 9466e122-8789-4dcf-bc52-52526e0b088e · outbound

This paper cites MAPLE: A Framework for Active Preference Learning Guided by Large Language Models.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning MAPLE: A Framework for Active Preference Learning Guided by Large Language Models

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-08-09T01:04:04.236834Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-09T01:04:04.134254Z digest=sha256:79406fca05c23b2ad699006dd16955db814ab99d0de89296ecf05015aa50bbcd

Observation d4789680-6288-45d6-b030-618b320d2ccc · outbound

This paper cites Batch active preference-based learning of reward functions,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Batch active preference-based learning of reward functions,

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.365667Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-09T01:04:04.136933Z digest=sha256:6e204696a11f90cc7e1aa74eb1dce3a39e8fd420f22b5e981911d3094b3d579c

Observation 35ac569d-eb5e-48ca-be22-58e922b18a07 · outbound

This paper cites ICPL: Few-shot In-context Preference Learning via LLMs.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning ICPL: Few-shot In-context Preference Learning via LLMs

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.139176Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.139176Z digest=sha256:cdd86f127e85b26247fe165d3fa3f4268da35d78d9e83f2b34eb3a404f1a06dc

Observation 36d0384a-c41d-4b7b-8547-6004e5a37dce · outbound

This paper cites B-Pref: Benchmarking Preference-Based Reinforcement Learning.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning B-Pref: Benchmarking Preference-Based Reinforcement Learning

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.141508Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.141508Z digest=sha256:b988c48bd018c222d4cd7abae4ff3c597b06fef62e919e3c0c411390c2c725d6

Observation d86b9fff-eb9e-41d3-9310-4f373a8b727b · outbound

This paper cites A bayesian approach for policy learning from trajectory preference queries,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning A bayesian approach for policy learning from trajectory preference queries,

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.356690Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-09T01:04:04.143870Z digest=sha256:ec3d95831e8038f9be0a5afff239f0589c10f240c25f347522f5467af227da34

Observation 6df6945f-7cda-4f7e-a133-e155c9af6660 · outbound

This paper cites Rank analysis of incomplete block designs: I. the method of paired comparisons,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Rank analysis of incomplete block designs: I. the method of paired comparisons,

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.146109Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.146109Z digest=sha256:8698d0f5594b63c87c998dd9856f3df0017ca60110d9c1e91c456e937591ee12

Observation 5c02d76a-77b5-477f-8028-75d4157eff5d · outbound

This paper cites Safe imitation learning via fast bayesian reward inference from preferences,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Safe imitation learning via fast bayesian reward inference from preferences,

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-09T01:04:04.342407Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.

source=pdf_text observed=2026-08-09T01:04:04.148428Z digest=sha256:9db0f32460871b190fa31dfcf4d34e4bee526b4b152a7239339f1dd59bdb2cb9

Observation 27c8227b-bf54-4de5-8750-a1e287986fcf · outbound

This paper cites SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning SURF: Semi-supervised Reward Learning with Data Augmentation for Feedback-efficient Preference-based Reinforcement Learning

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.151124Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.151124Z digest=sha256:9afb2edd7ad6c11bf59b2b5576b52a985ae0d1bb2d7299db3fbf262685d051f4

Observation 7e3833e5-4445-4fa7-8fc6-4177bf36919c · outbound

This paper cites Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.153622Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.153622Z digest=sha256:2b7e48b133feb79ba92e16a90dcbfca6d54f3cb8c0b23fd5784532fc84e5876f

Observation 163a41e4-fc20-47aa-9ab8-c13d796a35c5 · outbound

This paper cites Proximal Policy Optimization Algorithms.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Proximal Policy Optimization Algorithms

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.156322Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.156322Z digest=sha256:8560a52e7e8219de62bf519dddf680ae08aceb2978bba50c1576d1a8d6f4f128

Observation a1d407fa-3b44-4c3b-a192-a1c49da205f4 · outbound

This paper cites GPT-4 Technical Report.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning GPT-4 Technical Report

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.158705Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.158705Z digest=sha256:24af54d8bac4fdbeeb13b1ca6069e885819acf5a0cbf97d5be2b8a669ee9d94f

Observation 6ac6859e-a717-431a-9250-38252ec7df62 · outbound

This paper cites Chain-of-thought prompting elicits reasoning in large language models,.

Efficiently Generating Expressive Quadruped Behaviors via Language-Guided Preference Learning Chain-of-thought prompting elicits reasoning in large language models,

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-09T01:04:04.161124Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-09T01:04:04.161124Z digest=sha256:35d836eb90a74831099cccbd66bfcdf51e5241a3037f30eb9f79666007ff8fea

Pith citing papers

No inbound Pith citation observations are available.