{"as_of":"2026-08-16T17:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f6f77abfb11cd420dc18de1cda9cac93f51228aa8aadaf91236b81eea02031c2","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:11:01.051591Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.08500/citation-record","integrity":"/paper/2509.08500/integrity","json":"/paper/2509.08500/citation-record.json","paper":"/paper/2509.08500"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2012.05672","last_updated":"2021-01-21T03:25:38Z","snapshot_observed_at":"2026-08-13T04:22:46.004601Z","submitted_at":"2020-12-10T13:55:47Z","title":"Imitating Interactive Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.05672","snapshot_observed_at":"2026-08-15T16:11:00.766240Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.766240Z"},"links":{"cited_paper":"/paper/2012.05672","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:fe5bb5891da49ba3c4d7b3ad97c3b6c315f678a1653e9796e8c30a420460c225","observation_id":"87b29f39-d4d4-4a3c-9040-a70258a82d27","resolution":{"observed_at":"2026-08-15T16:11:00.766240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T16:11:00.772456Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.772456Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:3fa3d576e9d17ae4ab967cdc4ad9460c2ffcd9f8f0c0496790287dc8bd5923a4","observation_id":"9f56c574-3654-403d-b367-4c78d77d4259","resolution":{"observed_at":"2026-08-15T16:11:00.772456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-15T16:11:00.777561Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.777561Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:6229b403f397175f2cba39e5ecbfc73457edaa0d27dd3bc636892a436aca1d72","observation_id":"0b1041d3-34d7-40fc-bf73-871067a26eeb","resolution":{"observed_at":"2026-08-15T16:11:00.777561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-15T16:11:00.782636Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.782636Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:0fd8e16782189435ae29d57e54bd2bc1e0b622e870b465aac4f7938c4833d44a","observation_id":"b49d3562-4528-44df-90d7-1ffdc44cbe49","resolution":{"observed_at":"2026-08-15T16:11:00.782636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:01.900936Z","title":null,"venue":null,"work_id":"51cbfa57-29af-4acb-976f-3eccf286c2f5","year":2023},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.788505Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:ebef3521afc33c4dbc97b04fbd7fb1032794b196c5ab84ffa9196e417616180d","observation_id":"f4869960-63a6-49f1-8ab0-3854af2b47e6","resolution":{"observed_at":"2026-08-15T16:11:01.905661Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07657","last_updated":"2024-06-11T18:55:04Z","snapshot_observed_at":"2026-08-16T13:44:01.309407Z","submitted_at":"2024-06-11T18:55:04Z","title":"OPTune: Efficient Online Preference Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07657","snapshot_observed_at":"2026-08-15T16:11:00.792899Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.792899Z"},"links":{"cited_paper":"/paper/2406.07657","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:04b98253f5590b95199800f54cc0fa544a3704f4b0b887cfc1fb839c8ed67b90","observation_id":"4a2ffb51-0dff-4223-a3e4-9c42d215cd99","resolution":{"observed_at":"2026-08-15T16:11:00.792899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.08272","last_updated":"2019-12-19T15:44:33Z","snapshot_observed_at":"2026-08-14T18:12:26.613034Z","submitted_at":"2018-10-18T20:48:08Z","title":"BabyAI: A Platform to Study the Sample Efficiency of Grounded Language Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.08272","snapshot_observed_at":"2026-08-15T16:11:00.798499Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.798499Z"},"links":{"cited_paper":"/paper/1810.08272","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:76924f43ba383b569d849671090f573ed4a73842dff81e490b84ac40e677b8ed","observation_id":"bb2a0d2b-9cdb-42fe-94bf-bcc6da695259","resolution":{"observed_at":"2026-08-15T16:11:00.798499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:00.803929Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.803929Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:3c2841a65d42597524a517385ac583a4ca7604fe9f0021a3ccf784a04299f738","observation_id":"562355af-eb32-4f28-9f2b-398964c294d2","resolution":{"observed_at":"2026-08-15T16:11:00.803929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00763","last_updated":"2023-02-01T21:26:32Z","snapshot_observed_at":"2026-08-16T15:58:22.659639Z","submitted_at":"2023-02-01T21:26:32Z","title":"Collaborating with language models for embodied reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00763","snapshot_observed_at":"2026-08-15T16:11:00.808308Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.808308Z"},"links":{"cited_paper":"/paper/2302.00763","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:e9e19e862e773180bf5faeba38f049b18310f1a6795d3138f4aafa7781deb33c","observation_id":"c2e33a4e-4900-42bc-b1f6-96d16332c448","resolution":{"observed_at":"2026-08-15T16:11:00.808308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T18:47:26.721223Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-15T16:11:00.813141Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.813141Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:8e50714b98836f9f3a8bd835afdd3da5e8b676dbc5101370a0937a0e454e9164","observation_id":"a80fc14e-5391-41a6-8fe1-80fad7649b1b","resolution":{"observed_at":"2026-08-15T16:11:00.813141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:01.875131Z","title":null,"venue":null,"work_id":"0e6fd968-dc02-4d8e-b134-9b36492ed710","year":2021},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.819258Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:a6d8ad3cec0d7804e2cb1a2b0c2f9388a3cc74c6b9b6ee3a225bbf2ed1d3ea17","observation_id":"1d392e73-e90f-45dc-bbda-ae13166e4318","resolution":{"observed_at":"2026-08-15T16:11:01.880014Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-15T16:11:00.823923Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.823923Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:94c82a2c29d397ae3a0861f22c726cdbd3d1b019371e1e72fa3c78c4bd8dbbe1","observation_id":"129c308b-f37e-4701-b451-6d762e4964a6","resolution":{"observed_at":"2026-08-15T16:11:00.823923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:01.859265Z","title":null,"venue":null,"work_id":"bbf7a128-baed-42cc-ae0b-748a491dbf34","year":2023},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.829817Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:b7f3535997e7f6dcc72cae44a3d64d4e23f73f45d1fe6fe26c16fd4fa2dd3983","observation_id":"821b8223-5c76-44e9-b805-3a8b540e4131","resolution":{"observed_at":"2026-08-15T16:11:01.865597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:00.834186Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.834186Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:f319e73e0fc32676a4ddd25b2c8b42cc1d56a8ba11fa7dba6c77fecbc98c77d5","observation_id":"69624f41-b3f1-4e93-837c-429c3e74e991","resolution":{"observed_at":"2026-08-15T16:11:00.834186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-08T09:48:52.583612Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-15T16:11:00.838943Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.838943Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:f6313fda8b4e2c8e174d2443e1dc95b70b8b6bb913344b82884db68dcc48d6c3","observation_id":"db55326e-a261-47c8-8ad4-8a1368be8587","resolution":{"observed_at":"2026-08-15T16:11:00.838943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03094","last_updated":"2023-05-28T07:32:38Z","snapshot_observed_at":"2026-08-16T16:26:20.587132Z","submitted_at":"2022-10-06T17:50:11Z","title":"VIMA: General Robot Manipulation with Multimodal Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03094","snapshot_observed_at":"2026-08-15T16:11:00.845835Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.845835Z"},"links":{"cited_paper":"/paper/2210.03094","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:4d9767bdc5ddb43c4f416a27bbb0bb5d59ca93b54697284de76d1c8b17d7f702","observation_id":"3e5ec5ce-5a4a-47af-b0bc-f55ec56631be","resolution":{"observed_at":"2026-08-15T16:11:00.845835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:01.837191Z","title":null,"venue":null,"work_id":"dde823ef-e1a5-40ca-a247-4dbd42a5e1a3","year":2022},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.850449Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:5abd9bbd7fb4c3902982bd083f142eb8a33b30f4a03d8c03c67b8b6303a55d00","observation_id":"813a334c-acd1-4940-ae98-0427289f4bdb","resolution":{"observed_at":"2026-08-15T16:11:01.841417Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:01.823071Z","title":null,"venue":null,"work_id":"be52ce70-8429-4445-9a58-c43afdd2c0b7","year":2024},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.855488Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:34c4173e8542f8ba214ea883737d75fde294d9558bedd8faaa130397b412b213","observation_id":"27ac079e-be50-4e82-8777-a8dfe79a87cd","resolution":{"observed_at":"2026-08-15T16:11:01.828672Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-15T04:55:15.159462Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-15T16:11:00.860569Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.860569Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:3ae919f6395d7c430ca44238955c29031fb9447bb49c8a7dabe2773f06e21afb","observation_id":"97e20964-8a30-4e2b-a6d1-0fce6829b058","resolution":{"observed_at":"2026-08-15T16:11:00.860569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18629","last_updated":"2024-06-26T17:43:06Z","snapshot_observed_at":"2026-08-06T00:24:52.274888Z","submitted_at":"2024-06-26T17:43:06Z","title":"Step-DPO: Step-wise Preference Optimization for Long-chain Reasoning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18629","snapshot_observed_at":"2026-08-15T16:11:00.865781Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.865781Z"},"links":{"cited_paper":"/paper/2406.18629","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:1d2b1eb2ddbac9aa6bbcc88aeddf81d87048a6b679f22c014ba365c86f3fa90d","observation_id":"10d2c1ef-7518-47a2-9077-539b32c76d44","resolution":{"observed_at":"2026-08-15T16:11:00.865781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:01.807323Z","title":null,"venue":null,"work_id":"b1157901-ff9f-4df5-9011-a81b5ccdbd56","year":2022},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.870822Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:f48bee53a76f8f6059ab39c9ac6918bcc65b451543b991b2ab995a0c50034a7e","observation_id":"1eacf870-1e5d-4716-954b-f79a449c30aa","resolution":{"observed_at":"2026-08-15T16:11:01.812953Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:00.877005Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.877005Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:39805394a22bf1731953a993b2c194d0b415733a6f6a30cf3cf16ff7cc920c4c","observation_id":"afcb89d8-51ab-47a0-bee5-448108f9d5ed","resolution":{"observed_at":"2026-08-15T16:11:00.877005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-08-15T02:35:59.111911Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-15T16:11:00.885762Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.885762Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:10c0eb315add9e476835cda82ca247f16a8561453b774099c0662174b6c3af17","observation_id":"144c4876-7ef7-4261-ab6c-4d31d09730e7","resolution":{"observed_at":"2026-08-15T16:11:00.885762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-15T16:11:00.890802Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.890802Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:5ba4b6c3511af29fa84fb3e1e733b34f74616d2bb31c23d250c1b669264dd650","observation_id":"dc5e1e8a-3c45-46ba-b23e-0a1633568b5d","resolution":{"observed_at":"2026-08-15T16:11:00.890802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:01.771872Z","title":null,"venue":null,"work_id":"f10e4263-617a-4460-8d6c-377a50a3de69","year":2024},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.896012Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:213dcb810966444da724f2abaf2a6d57428179351a67dbda5a15b31b5611e788","observation_id":"206b4537-d745-432b-ac5d-f7fdcfb3567c","resolution":{"observed_at":"2026-08-15T16:11:01.787061Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:01.750071Z","title":null,"venue":null,"work_id":"10ae398c-e3b1-431a-99b5-28991e5fa39c","year":2020},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.901797Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:f73f0deac2156cff9e2ee59f1ed6694a2fd8c6e7e78bd8cae35d1e44588cd040","observation_id":"2d127f8f-ae53-4e0d-9bbc-45d8ec811fc5","resolution":{"observed_at":"2026-08-15T16:11:01.755003Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15021","last_updated":"2023-09-13T23:46:22Z","snapshot_observed_at":"2026-08-16T15:30:13.255971Z","submitted_at":"2023-05-24T11:04:30Z","title":"EmbodiedGPT: Vision-Language Pre-Training via Embodied Chain of Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15021","snapshot_observed_at":"2026-08-15T16:11:00.908527Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.908527Z"},"links":{"cited_paper":"/paper/2305.15021","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:6c5adc2fc228ac9f9b21c120345e09d7dcab60ec7e929010e8a875d859e1854e","observation_id":"36e3c82d-b90b-4dab-a148-3541925de2a7","resolution":{"observed_at":"2026-08-15T16:11:00.908527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-08-14T02:18:02.339361Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-15T16:11:00.913731Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.913731Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:d2044fda9e9c56c94b5cfecffe30028d021f0a7a1a595f25ba6c7c3e8646515c","observation_id":"010c77d7-6462-407e-98ee-01b1524edbee","resolution":{"observed_at":"2026-08-15T16:11:00.913731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:01.737254Z","title":null,"venue":null,"work_id":"03d30777-92c5-4263-a94d-7ea38945d703","year":2022},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.919964Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:e897ec4511a0a74c464a92ea34b7d90717cd7d91b3e23b94f8e5d43a425d9fbb","observation_id":"4d35374c-99af-484a-8f67-3e30b3e6d4a6","resolution":{"observed_at":"2026-08-15T16:11:01.741379Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-15T16:11:00.924355Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.924355Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:0e0ac9c24c3cff601b717bc6764364118a4b71c891c9ea9f2868abe377feb64f","observation_id":"c2c3ef01-97be-43d3-8910-f41be6b0d160","resolution":{"observed_at":"2026-08-15T16:11:00.924355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:01.724728Z","title":null,"venue":null,"work_id":"95458d6b-4c41-4d8c-a610-10db707a0181","year":2023},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.929926Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:a5bf6a0422e30d9085cab92fbd9dd309cb4cc1d29f38691b18be173d31329d31","observation_id":"6cea1050-7299-4ed4-802b-33a7fa550d43","resolution":{"observed_at":"2026-08-15T16:11:01.728816Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-15T16:11:00.934472Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.934472Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:5e47002744e1f6e42ce56eaaf9e6e5ecb96e83c806d4e70929af1579e3adf55b","observation_id":"42b97753-2795-4b45-90eb-9c2bad98b315","resolution":{"observed_at":"2026-08-15T16:11:00.934472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:00.939250Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.939250Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:447226d42a31b8b8ea24316d2e5b3822dddd725ea030e44ab14033f68c4e39c6","observation_id":"869b56a2-1051-4a2d-a67b-e1b60b722ecd","resolution":{"observed_at":"2026-08-15T16:11:00.939250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11366","last_updated":"2023-10-10T05:21:45Z","snapshot_observed_at":"2026-08-15T16:12:25.059113Z","submitted_at":"2023-03-20T18:08:50Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11366","snapshot_observed_at":"2026-08-15T16:11:00.943781Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.943781Z"},"links":{"cited_paper":"/paper/2303.11366","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:55ced6d697c3910128b8524b67300f6ee5e3f6674600007225f4a1dbafbc3ae5","observation_id":"d8631351-4987-4ff4-80dd-ee00d54ad4ce","resolution":{"observed_at":"2026-08-15T16:11:00.943781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:01.699859Z","title":null,"venue":null,"work_id":"6bca25d9-c5ee-40c0-b6ee-7d4daba56c2d","year":2022},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.949828Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:8b14efb927f922977d8457de586f66d3d6d2aa46790e047f05d6d802d89a7dd0","observation_id":"fd26df8c-2402-496d-8b7b-a916052f58b8","resolution":{"observed_at":"2026-08-15T16:11:01.705195Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01734","last_updated":"2020-03-31T01:18:33Z","snapshot_observed_at":"2026-08-12T02:06:48.074254Z","submitted_at":"2019-12-03T23:18:59Z","title":"ALFRED: A Benchmark for Interpreting Grounded Instructions for Everyday Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01734","snapshot_observed_at":"2026-08-15T16:11:00.953945Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.953945Z"},"links":{"cited_paper":"/paper/1912.01734","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:d3194ea96d55a1d73a9c47a507986a1d0070dbbec4b3238e4494686a63937941","observation_id":"d454170c-4997-47d0-b31b-38b5d23ecbbc","resolution":{"observed_at":"2026-08-15T16:11:00.953945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:00.959117Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.959117Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:89f30f6abc5a401fdd64a794c6084bcc9b4c9da5a59631a1b417cce09af9fa30","observation_id":"e15cd55d-153e-4c08-b6b3-9aad3c3e3d65","resolution":{"observed_at":"2026-08-15T16:11:00.959117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04088","last_updated":"2023-03-30T04:50:44Z","snapshot_observed_at":"2026-08-16T16:10:08.414728Z","submitted_at":"2022-12-08T05:46:32Z","title":"LLM-Planner: Few-Shot Grounded Planning for Embodied Agents with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04088","snapshot_observed_at":"2026-08-15T16:11:00.964019Z","title":"Sadler, Wei-Lun Chao, and Yu Su","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.964019Z"},"links":{"cited_paper":"/paper/2212.04088","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:74237b1f96d037f14b4f62ab6834bc2d1c7d65e64e20ae4e5d37a4f802cfb97b","observation_id":"a9ebf648-e27e-4221-b1c5-ac409db280b6","resolution":{"observed_at":"2026-08-15T16:11:00.964019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:01.676113Z","title":null,"venue":null,"work_id":"a9d120f6-a7d9-43e2-bd50-014f3ca55809","year":2018},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.968877Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:882732d8c99371689044b032b87639aabf4961de8aa2663001866c9baa8cad8f","observation_id":"379e5ebb-931f-46da-896f-3cc959faf73a","resolution":{"observed_at":"2026-08-15T16:11:01.680347Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17722","last_updated":"2024-04-16T17:54:06Z","snapshot_observed_at":"2026-08-16T14:48:29.437588Z","submitted_at":"2023-10-26T18:32:05Z","title":"Large Language Models as Generalizable Policies for Embodied Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17722","snapshot_observed_at":"2026-08-15T16:11:00.974344Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.974344Z"},"links":{"cited_paper":"/paper/2310.17722","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:d1a9421125c3f641d12077ef02ed9f6992077d50a6c96cc37a646b55ea1b43df","observation_id":"48887b85-f7a7-48e1-92a8-9a168ceba31c","resolution":{"observed_at":"2026-08-15T16:11:00.974344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14151","last_updated":"2024-03-11T03:15:58Z","snapshot_observed_at":"2026-08-16T14:24:34.824089Z","submitted_at":"2024-01-25T13:03:20Z","title":"True Knowledge Comes from Practice: Aligning LLMs with Embodied Environments via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14151","snapshot_observed_at":"2026-08-15T16:11:00.980528Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.980528Z"},"links":{"cited_paper":"/paper/2401.14151","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:e59323d39be650fea5552d698606b2b5e4fad1ec8cd649fd0c890fa8afc170d9","observation_id":"f35751e6-0ba2-405d-a205-e6b8a554c955","resolution":{"observed_at":"2026-08-15T16:11:00.980528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-15T16:11:00.986012Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.986012Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:8f39f746e43071f2505220d23b07b996d38e4b2f8095ee84a1d41257698cc354","observation_id":"b0284552-175a-4dcd-b962-09625b13b4aa","resolution":{"observed_at":"2026-08-15T16:11:00.986012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16291","last_updated":"2023-10-19T16:27:03Z","snapshot_observed_at":"2026-08-13T16:55:46.498156Z","submitted_at":"2023-05-25T17:46:38Z","title":"Voyager: An Open-Ended Embodied Agent with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16291","snapshot_observed_at":"2026-08-15T16:11:00.993052Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.993052Z"},"links":{"cited_paper":"/paper/2305.16291","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:47dc3dad2c98a734e83336b8c3b08c6853d4dbc437b2d8ba367ae1cbc8e53fa4","observation_id":"7312b00f-c7f5-42d3-a04d-ac2c832597c7","resolution":{"observed_at":"2026-08-15T16:11:00.993052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01560","last_updated":"2024-07-08T05:56:47Z","snapshot_observed_at":"2026-08-02T14:50:04.461434Z","submitted_at":"2023-02-03T06:06:27Z","title":"Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01560","snapshot_observed_at":"2026-08-15T16:11:00.998779Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:00.998779Z"},"links":{"cited_paper":"/paper/2302.01560","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:3495b4d0d4630e29a98b7703a02e27b2f225483d05a2b0d93ae41b2ed901fefa","observation_id":"867aaa16-e278-4b50-9f21-71f28701bf5c","resolution":{"observed_at":"2026-08-15T16:11:00.998779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02385","last_updated":"2024-02-04T07:55:01Z","snapshot_observed_at":"2026-08-16T14:21:45.728518Z","submitted_at":"2024-02-04T07:55:01Z","title":"A Survey on Robotics with Foundation Models: toward Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02385","snapshot_observed_at":"2026-08-15T16:11:01.004013Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:01.004013Z"},"links":{"cited_paper":"/paper/2402.02385","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:410a3a61f22fac5692ea1024e29d3ebf7bc2255fbffec61a851fb676125e3b12","observation_id":"e85970ca-6342-4352-93bd-9e30cc75a47d","resolution":{"observed_at":"2026-08-15T16:11:01.004013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:01.010642Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:01.010642Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:9f0171744ec84092d6b04b34bbf09747b960cdd3ca6c459a5554c5203093299a","observation_id":"e660ba09-3afa-4256-85b3-35384d12acd8","resolution":{"observed_at":"2026-08-15T16:11:01.010642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-15T16:11:01.017570Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:01.017570Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:1ec0ff8afd5d50d04c858ba8df4136803f9a31e64c207f9c68be0a1df1c4f6fd","observation_id":"8b5ca6b3-37ac-4d39-8647-1e157589c1c6","resolution":{"observed_at":"2026-08-15T16:11:01.017570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-08-15T16:11:01.027185Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:01.027185Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:82fc3caa607daf0e73fdd6dc9db4038b0a0aa7d0829417f0a418703877499f73","observation_id":"2a65a84a-288d-4b3b-adef-a8f45a76fec9","resolution":{"observed_at":"2026-08-15T16:11:01.027185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00598","last_updated":"2022-05-27T17:52:50Z","snapshot_observed_at":"2026-08-13T04:37:51.649726Z","submitted_at":"2022-04-01T17:43:13Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.00598","snapshot_observed_at":"2026-08-15T16:11:01.031589Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:01.031589Z"},"links":{"cited_paper":"/paper/2204.00598","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:05e9202169755b65a33535046bba84a4ff7c5fc38b8d1d85bb0f0500c59abd14","observation_id":"03ab1afe-3796-4add-bf1c-ac130e4bf1ec","resolution":{"observed_at":"2026-08-15T16:11:01.031589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.10292","last_updated":"2024-10-07T19:13:47Z","snapshot_observed_at":"2026-08-16T13:52:04.740660Z","submitted_at":"2024-05-16T17:50:19Z","title":"Fine-Tuning Large Vision-Language Models as Decision-Making Agents via Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.10292","snapshot_observed_at":"2026-08-15T16:11:01.036940Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:01.036940Z"},"links":{"cited_paper":"/paper/2405.10292","citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:fd022ed886b333cd57695e99baf74b4d7df5e54efb236a4e29003610d232bc87","observation_id":"b3a8be4e-9ebd-45f0-a26e-e792535251c5","resolution":{"observed_at":"2026-08-15T16:11:01.036940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:01.660226Z","title":null,"venue":null,"work_id":"f82a2cec-0503-4e14-a45d-771ea0b384d0","year":2023},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:01.041510Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:0f78411218bdb3701c1ef43b116ecac1c9985a736e7e221472ace72eebe4d5b9","observation_id":"b000d9bf-5e07-480e-ba36-748488e8d227","resolution":{"observed_at":"2026-08-15T16:11:01.666476Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:01.045998Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:01.045998Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:b53fb9e16b3b5fb6ae82c74d6fc6b20c398825894d9c04a6aefffedbce9ac176","observation_id":"002e3b0c-c23a-41aa-9a25-bad7182398c5","resolution":{"observed_at":"2026-08-15T16:11:01.045998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:11:01.051591Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T16:11:01.051591Z"},"links":{"citing_paper":"/paper/2509.08500"},"observation_digest":"sha256:297afb279646b51d06e9494ca6b59b05505b99994ea2c741c5b14adf6c8ecce5","observation_id":"a8342e27-d07c-486c-af36-f53be54b84fc","resolution":{"observed_at":"2026-08-15T16:11:01.051591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.08500","last_updated":"2025-09-10T11:16:21Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-15T15:59:39.700687Z","submitted_at":"2025-09-10T11:16:21Z","title":"TCPO: Thought-Centric Preference Optimization for Effective Embodied Decision-making"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2509.08500."}