{"as_of":"2026-08-21T22:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b884f2af35723e89b77968dde7a1b3b0405f3cf913386e171541ca47c48a07b1","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T18:38:32.683746Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T19:23:45.402022Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T04:09:35.083408Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"cited_work":{"arxiv_id":"2603.07530","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.07530","snapshot_observed_at":"2026-07-21T01:19:54.117323Z","title":"Iclr: In-context imitation learning with visual reasoning, 2026.https://arxiv.org/abs/2603.07530","venue":null,"work_id":"1b27e6ec-3b98-4e91-b62a-602ab8c0df63","year":2026},"citing_paper":{"arxiv_id":"2606.08154","last_updated":"2026-06-06T13:09:47Z","snapshot_observed_at":"2026-08-13T04:20:24.178755Z","submitted_at":"2026-06-06T13:09:47Z","title":"SynthICL: Scalable In-context Imitation Learning with Synthetic Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T19:23:45.402022Z"},"links":{"cited_paper":"/paper/2603.07530","citing_paper":"/paper/2606.08154"},"observation_digest":"sha256:525d52881134ac8c73086c8e86ebde8c6dfedcaaf3c4436fe59d24f8407be327","observation_id":"6dd66034-f8ad-4778-9593-c0c2b758e45a","resolution":{"observed_at":"2026-07-21T01:19:54.117323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"cited_work":{"arxiv_id":"2603.07530","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.07530","snapshot_observed_at":"2026-07-21T01:19:54.117323Z","title":"Iclr: In-context imitation learning with visual reasoning, 2026.https://arxiv.org/abs/2603.07530","venue":null,"work_id":"1b27e6ec-3b98-4e91-b62a-602ab8c0df63","year":2026},"citing_paper":{"arxiv_id":"2606.20781","last_updated":"2026-06-18T17:05:19Z","snapshot_observed_at":"2026-08-13T05:52:18.238364Z","submitted_at":"2026-06-18T17:05:19Z","title":"World Action Models: A Survey","version":1},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-06-26T17:11:12.686936Z"},"links":{"cited_paper":"/paper/2603.07530","citing_paper":"/paper/2606.20781"},"observation_digest":"sha256:f1ac9fbf901915dd121791285d78bf2596de1c039a8a57887e398adc41f5a0a1","observation_id":"9c2511c8-82be-4f77-9a93-24c4d2d67409","resolution":{"observed_at":"2026-07-21T01:19:54.117323Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.07530/citation-record","integrity":"/paper/2603.07530/integrity","json":"/paper/2603.07530/citation-record.json","paper":"/paper/2603.07530"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:27.085805Z","title":"Good old-fashioned engineering can close the 100,000- year “data gap","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:27.085805Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:28c6662fa9114e6e01ee77e7a1a7ac98f7b685e1361f5a3ac20abaa1c3d15519","observation_id":"d80c348b-5981-4ee2-9662-c6063109bd82","resolution":{"observed_at":"2026-08-02T18:38:27.085805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:27.165280Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:27.165280Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:eb4372ffc49ecc8feb16c462e855e038ef5eb770ddca615a346513a99d13f6a0","observation_id":"9ffcc999-6676-4d50-904b-21c27005fde1","resolution":{"observed_at":"2026-08-02T18:38:27.165280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:27.311037Z","title":"Bc-z: Zero-shot task generalization with robotic imitation learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:27.311037Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:163af5cb33029cd8478d38c9b44605d254fc6c21bef942412ce0c983ade92928","observation_id":"78b35951-be7a-44b8-9a07-68051b20f17f","resolution":{"observed_at":"2026-08-02T18:38:27.311037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:27.425122Z","title":"Rovi-aug: Robot and viewpoint augmentation for cross-embodiment robot learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:27.425122Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:1681cc9f3024360918cc5059ffaf1e5a70422d6aa610eeb57b2e4ba3d5a7b980","observation_id":"3eac1579-ba3d-4dab-adca-b916b374d69d","resolution":{"observed_at":"2026-08-02T18:38:27.425122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:27.565031Z","title":"Icrt: In-context imitation learning via next-token prediction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:27.565031Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:7aae593a57b9df0c9332d4694e2c51bd1e6a505f094922d7bb430a8cae0ccdff","observation_id":"4311fc8c-d289-46fb-bca1-cf379e6ebfb8","resolution":{"observed_at":"2026-08-02T18:38:27.565031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:27.813897Z","title":"Novel demonstration generation with gaussian splatting enables ro- bust one-shot manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:27.813897Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:7848730f55380e2a7e2b476d7e526d65462e40eb496175bd5f203f21afc6abfd","observation_id":"96b0dea1-4da1-44df-911d-59bfaf99ef60","resolution":{"observed_at":"2026-08-02T18:38:27.813897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-08-09T12:54:21.149243Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-02T18:38:28.003247Z","title":"World action models are zero- shot policies,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:28.003247Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:c0cbf63ea629d84ce930b324807bcbe19041d5669c3447df0668cdb0b670cc73","observation_id":"ade2ccc9-72c9-4867-8d39-a29f175c9d67","resolution":{"observed_at":"2026-08-02T18:38:28.003247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:28.142854Z","title":"A systematic study of data modalities and strategies for co-training large behavior models for robot manipulation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:28.142854Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:6628bf575862cfd766c130196d412d29ea578fc4fd5e1c5566a91b4245fd11e7","observation_id":"8d127a3f-d17d-4ce2-b003-6b5fb5ccd416","resolution":{"observed_at":"2026-08-02T18:38:28.142854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:28.259751Z","title":"Keypoint action tokens enable in-context imitation learning in robotics,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:28.259751Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:b78b5ccc35907e90663cec494b820bb2e6e5c0c21b081bfdbdcacf9eafdddc9b","observation_id":"13bc154e-1da5-4d4f-b7a2-15be5b94a6b6","resolution":{"observed_at":"2026-08-02T18:38:28.259751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:28.453787Z","title":"Instant policy: In-context imitation learning via graph diffusion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:28.453787Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:5f5cc6928b05c5510ef8bbcbfee3a64418af311f7efa7fef9b9389890e42425b","observation_id":"cf2654fc-c237-4ef8-902b-82b9d9e9a1e9","resolution":{"observed_at":"2026-08-02T18:38:28.453787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:28.624749Z","title":"Mimicdroid: In-context learning for humanoid manipulation from human play videos,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:28.624749Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:ed627f6f9ba0468c2e3cfce1bb071e622342a0a04b60f18a66cce0367d389ef5","observation_id":"ba46dd64-f7b8-4409-8b67-e45bfb2cb271","resolution":{"observed_at":"2026-08-02T18:38:28.624749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:28.713775Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:28.713775Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:bea081c6e686eaee655842479e886824a509fc1c1639c6e28ec6ea0080dd0792","observation_id":"3c52c04e-4d7b-4e2f-9b8b-c0de83b56db8","resolution":{"observed_at":"2026-08-02T18:38:28.713775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:28.803936Z","title":"Ddcot: Duty-distinct chain-of-thought prompting for multimodal reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:28.803936Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:3777d93a1cac3a1a7d2525e5d04507a38d21bcf782025c1a30135b18ce76f7af","observation_id":"19c3dd14-e035-4a5f-8076-4af38194a9f5","resolution":{"observed_at":"2026-08-02T18:38:28.803936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:28.896572Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:28.896572Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:2dd531f0f13e9cd35438d792f87589fe8190f7508ac7479798180a0a7a4a85ce","observation_id":"3c96c0ec-34ef-4a44-9228-74ef9ac3487a","resolution":{"observed_at":"2026-08-02T18:38:28.896572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:28.978623Z","title":"Few-shot in-context imitation learning via implicit graph alignment,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:28.978623Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:2e903bd37bdc6537f792b9706097fc50516947e95ac3cc49c34608943d4e77f0","observation_id":"b1bc496a-41a2-4659-a2ce-b2fc38baf200","resolution":{"observed_at":"2026-08-02T18:38:28.978623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:29.104355Z","title":"Vid2robot: End-to- end video-conditioned policy learning with cross-attention transform- ers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:29.104355Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:8ddaa5b54fe5f9c600b53dff34f05f6fb450a4d9e411a0e7df1a053bc4e6cdab","observation_id":"59ff90f1-920d-44c4-bfbe-05fa3a7a0a05","resolution":{"observed_at":"2026-08-02T18:38:29.104355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:29.213358Z","title":"Ricl: Adding in- context adaptability to pre-trained vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:29.213358Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:e722ba601ad2059c500efb651a0e83ba37e36264120bba0d7fc780d8664541f1","observation_id":"bf90aeba-e38a-4c74-ab3a-963cabe41a06","resolution":{"observed_at":"2026-08-02T18:38:29.213358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:29.363559Z","title":"Thinkact: Vision-language-action reasoning via reinforced visual la- tent planning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:29.363559Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:b4ab484dc8026e12fda119984604bee0ecbbbeaba9b180259e63804d78863b32","observation_id":"4186bb43-a20f-42b5-950c-1035caa8c1be","resolution":{"observed_at":"2026-08-02T18:38:29.363559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:29.495047Z","title":"Robotic control via embodied chain-of-thought reasoning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:29.495047Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:edcdf41473dc35c8703fd80fb4414fec146d35323f879184578e285f1e87ceeb","observation_id":"f6151216-eac9-41d5-ae41-388eb3614db0","resolution":{"observed_at":"2026-08-02T18:38:29.495047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:29.587167Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:29.587167Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:712d08b3cc2c2e80187af4056a706f1af040c338b7d7d5634af30f85d27896fa","observation_id":"c7819539-e49e-4782-a170-6ae5ce59e204","resolution":{"observed_at":"2026-08-02T18:38:29.587167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:29.742935Z","title":"Molmoact: Action reasoning models that can reason in space,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:29.742935Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:dc467978f7eb7697d104999a9af776548fc41a60903331583695cbf62b587d2b","observation_id":"9311bbc7-0518-4675-8896-261d9659116f","resolution":{"observed_at":"2026-08-02T18:38:29.742935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-13T04:40:33.458745Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-08-02T18:38:29.811396Z","title":"Gemini robotics: Bringing ai into the physical world,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:29.811396Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:28d86fcb975e2444de2564797311b59875b13bfc8ff7f5b2bf868597621b34d4","observation_id":"dcafd521-371d-4187-9fd5-0c9125342106","resolution":{"observed_at":"2026-08-02T18:38:29.811396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:29.910279Z","title":"pi0.5: a vision-language-action model with open-world generalization,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:29.910279Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:0234a8ccba73d691c664329a1152c05cf72714bddc96d104428b3e1bf98ebb1b","observation_id":"405bbe2e-f41b-47b2-914d-1a1945b1ee92","resolution":{"observed_at":"2026-08-02T18:38:29.910279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:30.061677Z","title":"Hamster: Hierarchical action models for open-world robot manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:30.061677Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:3e4b01b70be583d7fcbb8bff59efce942a2544a4c97f4aef89b99e8e17d1d502","observation_id":"42e832b9-6ad8-47c6-8b4b-62824c7af6d5","resolution":{"observed_at":"2026-08-02T18:38:30.061677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:30.177967Z","title":"Coa-vla: Improving vision-language-action models via visual-text chain-of-affordance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:30.177967Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:b439138283cd1409a6f1af432342e229402421dd06c747db3da4c2b63b7a3a8e","observation_id":"48b0227c-cf2a-45a6-afa7-9bf659dd65b6","resolution":{"observed_at":"2026-08-02T18:38:30.177967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:30.335213Z","title":"Peek: Guiding and minimal image representations for zero-shot generalization of robot manipulation policies,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:30.335213Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:8279ac2a9eb7905a1ea27cb5329294fd7606207e9add3c806d4e8d0c1e43373f","observation_id":"056963f4-df48-44f5-90b1-5f54ae9ea9e4","resolution":{"observed_at":"2026-08-02T18:38:30.335213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.10611","last_updated":"2026-04-02T16:01:02Z","snapshot_observed_at":"2026-08-16T00:44:08.264820Z","submitted_at":"2026-01-15T17:27:44Z","title":"Molmo2: Open Weights and Data for Vision-Language Models with Video Understanding and Grounding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.10611","snapshot_observed_at":"2026-08-02T18:38:30.443103Z","title":"Molmo2: Open weights and data for vision-language models with video understanding and grounding,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:30.443103Z"},"links":{"cited_paper":"/paper/2601.10611","citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:fde5d0b6a417155b0484bf524a5afde5fdecd9211b2e9cd23629778b2ce43f6b","observation_id":"5a8ef74c-9ec3-484f-a600-36815b438e8e","resolution":{"observed_at":"2026-08-02T18:38:30.443103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.03342","last_updated":"2025-11-28T18:57:04Z","snapshot_observed_at":"2026-07-06T22:31:40.462674Z","submitted_at":"2025-10-02T14:32:45Z","title":"Gemini Robotics 1.5: Pushing the Frontier of Generalist Robots with Advanced Embodied Reasoning, Thinking, and Motion Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.03342","snapshot_observed_at":"2026-08-02T18:38:30.577678Z","title":"Gemini robotics 1.5: Pushing the frontier of generalist robots with advanced embodied reasoning, thinking, and motion transfer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:30.577678Z"},"links":{"cited_paper":"/paper/2510.03342","citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:5a8f5151d34d51309b699afd348a7166154723035b57cab50dd8a34c3446f6b2","observation_id":"8562aa9d-4d8f-40f9-b2bf-b0b8b38853a6","resolution":{"observed_at":"2026-08-02T18:38:30.577678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T18:38:30.711742Z","title":"Qwen3-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:30.711742Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:30cc2d08a0159b05fea2b476b7dd06c26453ab172aad98eebc275ad6124f8806","observation_id":"2a75cda4-351e-4679-bacf-f1388c6c5b10","resolution":{"observed_at":"2026-08-02T18:38:30.711742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:30.815742Z","title":"Sam 2: Segment anything in images and videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:30.815742Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:e147ef8af08d20b3ee09308ddeadd8da019c94d64ca0ba0f24b9dd6eca608543","observation_id":"754b6d9c-30e8-473d-ae3c-02e53bdbea57","resolution":{"observed_at":"2026-08-02T18:38:30.815742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-08-18T01:07:23.737664Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-02T18:38:30.929430Z","title":"Sim ´eoni, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:30.929430Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:04c83f14708f13b8dde300a989f1967d24d8bf6c17bac1b996d34bf6239ac347","observation_id":"333daf4f-5ecc-4c47-87cb-02c260040d20","resolution":{"observed_at":"2026-08-02T18:38:30.929430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:31.070097Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:31.070097Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:f8298147d20f780103e757f15c7eac2515ea79026ca28efb68d98360b1692141","observation_id":"8c85f343-f28f-4e95-89a7-cbc00d6d3ad1","resolution":{"observed_at":"2026-08-02T18:38:31.070097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:31.243983Z","title":"Scaling open-vocabulary object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:31.243983Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:6fd4613e155f952dffb7c9ec623e0c7986efd88a5f50af26805144e8da5d66ad","observation_id":"de69b2ad-38eb-4722-8a3b-4b62cbe9bdea","resolution":{"observed_at":"2026-08-02T18:38:31.243983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:31.358590Z","title":"Hand me the data: Fast robot adaptation via hand path retrieval,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:31.358590Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:90e78b0bc8bb3f77c246a52f469770fa2434f86f39f5fcf36b75a370094d59df","observation_id":"5b4df95b-2733-4fd6-8e23-e6a0648451eb","resolution":{"observed_at":"2026-08-02T18:38:31.358590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.13193","last_updated":"2026-04-06T03:04:33Z","snapshot_observed_at":"2026-08-21T18:21:26.449632Z","submitted_at":"2026-02-13T18:57:56Z","title":"Steerable Vision-Language-Action Policies for Embodied Reasoning and Hierarchical Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.13193","snapshot_observed_at":"2026-08-02T18:38:31.486289Z","title":"Steerable vision-language- action policies for embodied reasoning and hierarchical control,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:31.486289Z"},"links":{"cited_paper":"/paper/2602.13193","citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:4e66c75cebd64cb19cd01bb7219fe061c5330704c8a8c92419b5e2258c0f85fc","observation_id":"73b1832e-b6f5-403c-b3ea-3b81b066e968","resolution":{"observed_at":"2026-08-02T18:38:31.486289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-02T18:38:31.571799Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:31.571799Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:2c9e41e9b30b78e05b2dc20b758f3b652716f4d08099df29ebc1c50cac487bdb","observation_id":"7e9376bf-7e01-455f-81a2-ea50aa33768e","resolution":{"observed_at":"2026-08-02T18:38:31.571799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:31.747133Z","title":"Set transformer: A framework for attention-based permutation-invariant neural networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:31.747133Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:1ee5527adea4bfd3432cba3b2a2d3d98652cf0422b9559cd052da9145dbf08a9","observation_id":"9fa11f34-4612-4028-998d-fb43d758e218","resolution":{"observed_at":"2026-08-02T18:38:31.747133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:31.927027Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:31.927027Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:b72973c9e932c9c32290f4611091d1fc27fff43615b8753c98484fb321c21492","observation_id":"599ea514-6f5a-4bf0-91c8-8d45cbc0f6b9","resolution":{"observed_at":"2026-08-02T18:38:31.927027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:32.022643Z","title":"Training strategies for efficient embodied reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:32.022643Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:e856c79f5cf13dfe48ce93805a92278022b0ebf4f2c89509c4988a6446f5a7ff","observation_id":"13b1dcc8-dbb7-41a9-86d7-f4d507547a59","resolution":{"observed_at":"2026-08-02T18:38:32.022643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:32.112890Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learn- ing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:32.112890Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:5c48b9db2c65ca0b8c530d7d47fff67117be8a76a10458637e27d0acafe92f99","observation_id":"91ddcbc1-cfbd-400b-8665-2f125be4b877","resolution":{"observed_at":"2026-08-02T18:38:32.112890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:32.228681Z","title":"Openvla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:32.228681Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:ed801b4f6b608b9628898af95b64455443eb59aa4f8ee6de740257ba56398d77","observation_id":"21aa1972-2f98-4fa4-83ec-bc111325ed86","resolution":{"observed_at":"2026-08-02T18:38:32.228681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:32.354144Z","title":"Universal manipulation interface: In-the-wild robot teaching without in-the-wild robots,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:32.354144Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:9209f7c5091afcc967609ca45d90bc0c482cecb4511a6c1d11ff10112187692f","observation_id":"6ad5e4be-21bd-457a-86cc-e18f711bd331","resolution":{"observed_at":"2026-08-02T18:38:32.354144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:32.486598Z","title":"Gello: A general, low- cost, and intuitive teleoperation framework for robot manipulators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:32.486598Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:f743d3bf3503407e67f1a0d86cedcce4e31f4810c5dce38944355e3f0ef33db0","observation_id":"c8977d95-6cc2-40b2-ab05-5793e07c9826","resolution":{"observed_at":"2026-08-02T18:38:32.486598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:32.598356Z","title":"Lmact: A benchmark for in-context imitation learning with long multimodal demonstrations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:32.598356Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:3158ddcb635338a012a877a165eac2eb8791a9b7afdcb7dce4e70727e8cf039a","observation_id":"28197a0e-f769-4046-a997-65462d5e87b6","resolution":{"observed_at":"2026-08-02T18:38:32.598356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:38:32.683746Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T18:38:32.683746Z"},"links":{"citing_paper":"/paper/2603.07530"},"observation_digest":"sha256:6026d7710f43334d4f7e4fa4603f1634a1845bff4e82426e9d776a4d69afe946","observation_id":"0408feb0-c3c0-449c-bc0a-bcf73051b30e","resolution":{"observed_at":"2026-08-02T18:38:32.683746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.07530","last_updated":"2026-07-17T20:37:13Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T15:22:43.228173Z","submitted_at":"2026-03-08T08:40:05Z","title":"ICLR: In-Context Imitation Learning with Visual Reasoning"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 2 inbound Pith citation observations for arXiv:2603.07530."}