{"as_of":"2026-08-09T14:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7c51830cfb0063d1cc963db847c1c22082cef599852b4a86a3b0716772654ea4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":14,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":14,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":14,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":14,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T01:01:49.881280Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T22:16:36.381522Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.12943","last_updated":"2024-08-27T23:15:11Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:47:37Z","title":"Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers","version":2},"cited_work":{"arxiv_id":"2403.12943","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.12943","snapshot_observed_at":"2026-07-09T22:16:36.381522Z","title":"Vid2robot: End-to-end video-conditioned policy learning with cross-attention transformers","venue":"cs.RO","work_id":"09dec5e4-4840-45a1-ba7f-89d3d2792a01","year":2024},"citing_paper":{"arxiv_id":"2409.16283","last_updated":"2024-09-24T17:57:33Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T17:57:33Z","title":"Gen2Act: Human Video Generation in Novel Scenarios enables Generalizable Robot Manipulation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-15T12:17:01.294466Z"},"links":{"cited_paper":"/paper/2403.12943","citing_paper":"/paper/2409.16283"},"observation_digest":"sha256:6bd76eb4089de86a42ccb09b54bab6e3f60c9961a348e65afa1b1d191739bb46","observation_id":"1f54d54d-777c-4a64-807e-a2aad2cf201b","resolution":{"observed_at":"2026-05-15T12:17:01.425532Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12943","last_updated":"2024-08-27T23:15:11Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:47:37Z","title":"Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12943","snapshot_observed_at":"2026-08-09T01:01:49.881280Z","title":"Vid2robot: End-to-end video-conditioned policy learn- ing with cross-attention transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.03729","last_updated":"2025-02-11T04:51:45Z","snapshot_observed_at":"2026-08-09T00:55:04.068120Z","submitted_at":"2025-02-06T02:43:23Z","title":"Action-Free Reasoning for Policy Generalization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T01:01:49.881280Z"},"links":{"cited_paper":"/paper/2403.12943","citing_paper":"/paper/2502.03729"},"observation_digest":"sha256:84b48b2d845049d15eacf968c9328ff9f1657b137452f2ec30498920044a5f00","observation_id":"1b1f8b56-47d3-4cda-b77d-f2bcf6e103a9","resolution":{"observed_at":"2026-08-09T01:01:49.881280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12943","last_updated":"2024-08-27T23:15:11Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:47:37Z","title":"Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12943","snapshot_observed_at":"2026-08-07T13:51:25.743860Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20795","last_updated":"2026-05-29T12:22:36Z","snapshot_observed_at":"2026-08-08T23:33:37.619713Z","submitted_at":"2025-05-27T06:56:14Z","title":"Learning Generalizable Robot Policy with Human Demonstration Video as a Prompt","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:51:25.743860Z"},"links":{"cited_paper":"/paper/2403.12943","citing_paper":"/paper/2505.20795"},"observation_digest":"sha256:5a6c9c5451b5929a9f101fe8d1a8122c83dd2d82d0e6af6b43994999010f92be","observation_id":"3a7c7053-cb28-479e-8e60-d78e5b54088f","resolution":{"observed_at":"2026-08-07T13:51:25.743860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12943","last_updated":"2024-08-27T23:15:11Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:47:37Z","title":"Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12943","snapshot_observed_at":"2026-08-04T18:51:36.054289Z","title":"Vid2robot: End-to-end video-conditioned pol- icy learning with cross-attention transformers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.09769","last_updated":"2025-09-11T18:02:48Z","snapshot_observed_at":"2026-08-08T20:08:45.321600Z","submitted_at":"2025-09-11T18:02:48Z","title":"MimicDroid: In-Context Learning for Humanoid Robot Manipulation from Human Play Videos","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T18:51:36.054289Z"},"links":{"cited_paper":"/paper/2403.12943","citing_paper":"/paper/2509.09769"},"observation_digest":"sha256:e95523fb5a4abef09a722f23e9990256d9877cf0c31e8058508051b0731dca17","observation_id":"10acbeeb-755b-47a5-817c-206621baabf8","resolution":{"observed_at":"2026-08-04T18:51:36.054289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12943","last_updated":"2024-08-27T23:15:11Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:47:37Z","title":"Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers","version":2},"cited_work":{"arxiv_id":"2403.12943","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.12943","snapshot_observed_at":"2026-07-09T22:16:36.381522Z","title":"Vid2robot: End-to-end video-conditioned policy learning with cross-attention transformers","venue":"cs.RO","work_id":"09dec5e4-4840-45a1-ba7f-89d3d2792a01","year":2024},"citing_paper":{"arxiv_id":"2511.04671","last_updated":"2026-04-15T03:42:52Z","snapshot_observed_at":"2026-08-01T04:13:43.111071Z","submitted_at":"2025-11-06T18:56:30Z","title":"X-Diffusion: Training Diffusion Policies on Cross-Embodiment Human Demonstrations","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T00:37:12.170711Z"},"links":{"cited_paper":"/paper/2403.12943","citing_paper":"/paper/2511.04671"},"observation_digest":"sha256:800296be9f831d5e7430d60c03a7b080316d945db0eabb540628decbdba2895a","observation_id":"6d471f07-c92a-459a-99ea-cfb68383ce45","resolution":{"observed_at":"2026-05-18T00:40:33.758626Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12943","last_updated":"2024-08-27T23:15:11Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:47:37Z","title":"Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers","version":2},"cited_work":{"arxiv_id":"2403.12943","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.12943","snapshot_observed_at":"2026-07-09T22:16:36.381522Z","title":"Vid2robot: End-to-end video-conditioned policy learning with cross-attention transformers","venue":"cs.RO","work_id":"09dec5e4-4840-45a1-ba7f-89d3d2792a01","year":2024},"citing_paper":{"arxiv_id":"2605.29298","last_updated":"2026-05-28T03:27:38Z","snapshot_observed_at":"2026-08-06T06:51:27.988734Z","submitted_at":"2026-05-28T03:27:38Z","title":"MonoDuo: Using One Robot Arm to Learn Bimanual Policies","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-29T07:22:17.679021Z"},"links":{"cited_paper":"/paper/2403.12943","citing_paper":"/paper/2605.29298"},"observation_digest":"sha256:9b0c775e3157f7600c5f00362e98f63ee1302d90468fae04c7e9f29ec6ba078f","observation_id":"9822926b-549b-4efd-8df1-35e56a64c3a1","resolution":{"observed_at":"2026-06-29T07:23:12.504103Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12943","last_updated":"2024-08-27T23:15:11Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:47:37Z","title":"Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers","version":2},"cited_work":{"arxiv_id":"2403.12943","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.12943","snapshot_observed_at":"2026-07-09T22:16:36.381522Z","title":"Vid2robot: End-to-end video-conditioned policy learning with cross-attention transformers","venue":"cs.RO","work_id":"09dec5e4-4840-45a1-ba7f-89d3d2792a01","year":2024},"citing_paper":{"arxiv_id":"2606.00110","last_updated":"2026-05-27T03:38:15Z","snapshot_observed_at":"2026-08-06T22:19:24.528783Z","submitted_at":"2026-05-27T03:38:15Z","title":"General Covariant Action Modeling: Constructing Generalized Manifolds via Spatio-Temporal Decoupling","version":1},"reference_index":180,"source":"arxiv_source","source_observed_at":"2026-06-29T13:33:03.368006Z"},"links":{"cited_paper":"/paper/2403.12943","citing_paper":"/paper/2606.00110"},"observation_digest":"sha256:980598b6d785c0c056a7b272d10f9f00b51b8f09328d22ed6935f5f8773fe03b","observation_id":"22f8a5fe-0331-4c21-bd76-2aad2605fb70","resolution":{"observed_at":"2026-06-29T13:33:27.849572Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12943","last_updated":"2024-08-27T23:15:11Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:47:37Z","title":"Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers","version":2},"cited_work":{"arxiv_id":"2403.12943","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.12943","snapshot_observed_at":"2026-07-09T22:16:36.381522Z","title":"Vid2robot: End-to-end video-conditioned policy learning with cross-attention transformers","venue":"cs.RO","work_id":"09dec5e4-4840-45a1-ba7f-89d3d2792a01","year":2024},"citing_paper":{"arxiv_id":"2606.08154","last_updated":"2026-06-06T13:09:47Z","snapshot_observed_at":"2026-08-02T00:10:31.681211Z","submitted_at":"2026-06-06T13:09:47Z","title":"SynthICL: Scalable In-context Imitation Learning with Synthetic Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T19:23:45.402022Z"},"links":{"cited_paper":"/paper/2403.12943","citing_paper":"/paper/2606.08154"},"observation_digest":"sha256:efedaffbeb3299582a05558c220fb7671d85b88c8855bae46732f8ed4a02b402","observation_id":"a5ae3bd1-d1c1-412e-9acc-fa82ad88fd8c","resolution":{"observed_at":"2026-07-02T21:57:25.875163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12943","last_updated":"2024-08-27T23:15:11Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:47:37Z","title":"Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers","version":2},"cited_work":{"arxiv_id":"2403.12943","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.12943","snapshot_observed_at":"2026-07-09T22:16:36.381522Z","title":"Vid2robot: End-to-end video-conditioned policy learning with cross-attention transformers","venue":"cs.RO","work_id":"09dec5e4-4840-45a1-ba7f-89d3d2792a01","year":2024},"citing_paper":{"arxiv_id":"2606.17385","last_updated":"2026-06-19T08:44:25Z","snapshot_observed_at":"2026-08-01T15:20:43.162291Z","submitted_at":"2026-06-16T00:44:16Z","title":"EgoInfinity: A Web-Scale 4D Hand-Object Interaction Data Engine for Any-View Robot Retargeting and Video-to-Action Robot Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T01:35:25.740110Z"},"links":{"cited_paper":"/paper/2403.12943","citing_paper":"/paper/2606.17385"},"observation_digest":"sha256:db3f6d6d67a2577b49dd632fc61d436bd8177f4917c1928ee5561fd5404c5dc6","observation_id":"bb398fcd-6270-4c20-b429-1c078dc459b9","resolution":{"observed_at":"2026-07-03T20:08:56.423229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12943","last_updated":"2024-08-27T23:15:11Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:47:37Z","title":"Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers","version":2},"cited_work":{"arxiv_id":"2403.12943","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.12943","snapshot_observed_at":"2026-07-09T22:16:36.381522Z","title":"Vid2robot: End-to-end video-conditioned policy learning with cross-attention transformers","venue":"cs.RO","work_id":"09dec5e4-4840-45a1-ba7f-89d3d2792a01","year":2024},"citing_paper":{"arxiv_id":"2606.26025","last_updated":"2026-07-03T15:34:07Z","snapshot_observed_at":"2026-07-12T12:05:57.041170Z","submitted_at":"2026-06-24T16:53:36Z","title":"In-Context World Modeling for Robotic Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-25T19:12:22.513577Z"},"links":{"cited_paper":"/paper/2403.12943","citing_paper":"/paper/2606.26025"},"observation_digest":"sha256:be44d7bdb7365ca7436ae7c04fc86087d0ee4b98507ad193cd6b1bebacc567cb","observation_id":"3dbc32e8-6aaa-4d65-bf1b-f936ee1834f3","resolution":{"observed_at":"2026-07-04T21:00:09.584646Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12943","last_updated":"2024-08-27T23:15:11Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:47:37Z","title":"Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers","version":2},"cited_work":{"arxiv_id":"2403.12943","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.12943","snapshot_observed_at":"2026-07-09T22:16:36.381522Z","title":"Vid2robot: End-to-end video-conditioned policy learning with cross-attention transformers","venue":"cs.RO","work_id":"09dec5e4-4840-45a1-ba7f-89d3d2792a01","year":2024},"citing_paper":{"arxiv_id":"2606.26025","last_updated":"2026-07-03T15:34:07Z","snapshot_observed_at":"2026-07-12T12:05:57.041170Z","submitted_at":"2026-06-24T16:53:36Z","title":"In-Context World Modeling for Robotic Control","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T05:11:07.089829Z"},"links":{"cited_paper":"/paper/2403.12943","citing_paper":"/paper/2606.26025"},"observation_digest":"sha256:f4907efcb3d8e32e7c8206496e0916d408b3b64f1823f8aea16c9e671ede5668","observation_id":"984a43b8-6ba8-40d4-b44f-acfa9417ff3f","resolution":{"observed_at":"2026-07-04T13:29:51.616019Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12943","last_updated":"2024-08-27T23:15:11Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:47:37Z","title":"Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12943","snapshot_observed_at":"2026-07-12T12:05:57.682386Z","title":"Joshi, Ayzaan Wahid, Danny Driess, Quan Vuong, Pannag R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.26025","last_updated":"2026-07-03T15:34:07Z","snapshot_observed_at":"2026-07-12T12:05:57.041170Z","submitted_at":"2026-06-24T16:53:36Z","title":"In-Context World Modeling for Robotic Control","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-12T12:05:57.682386Z"},"links":{"cited_paper":"/paper/2403.12943","citing_paper":"/paper/2606.26025"},"observation_digest":"sha256:43c3ce5833593e54596e5f51c3e6c539a4447fd28ce8efe38b7bbd0245deafbd","observation_id":"a3d179df-d985-4252-8814-069ac488d1a8","resolution":{"observed_at":"2026-07-12T12:05:57.682386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12943","last_updated":"2024-08-27T23:15:11Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:47:37Z","title":"Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers","version":2},"cited_work":{"arxiv_id":"2403.12943","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.12943","snapshot_observed_at":"2026-07-09T22:16:36.381522Z","title":"Vid2robot: End-to-end video-conditioned policy learning with cross-attention transformers","venue":"cs.RO","work_id":"09dec5e4-4840-45a1-ba7f-89d3d2792a01","year":2024},"citing_paper":{"arxiv_id":"2607.06988","last_updated":"2026-07-10T02:22:52Z","snapshot_observed_at":"2026-08-07T16:54:08.238920Z","submitted_at":"2026-07-08T04:23:22Z","title":"WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-09T22:16:31.529359Z"},"links":{"cited_paper":"/paper/2403.12943","citing_paper":"/paper/2607.06988"},"observation_digest":"sha256:fe7ecbb437dfe667d55afedf07adc83cb29274d9c4ce3743d19eec937687e469","observation_id":"0d801c73-4984-416d-8b0f-34d423ede1ed","resolution":{"observed_at":"2026-07-09T22:16:36.382745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12943","last_updated":"2024-08-27T23:15:11Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:47:37Z","title":"Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12943","snapshot_observed_at":"2026-07-13T06:48:14.554799Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.06988","last_updated":"2026-07-10T02:22:52Z","snapshot_observed_at":"2026-08-07T16:54:08.238920Z","submitted_at":"2026-07-08T04:23:22Z","title":"WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T06:48:14.554799Z"},"links":{"cited_paper":"/paper/2403.12943","citing_paper":"/paper/2607.06988"},"observation_digest":"sha256:996ca71fd8eb1524c2570df00e44580d582cf967c39f57014693602497953e00","observation_id":"fcbc64e7-e5f8-4c8e-b8bd-09bcc44480ca","resolution":{"observed_at":"2026-07-13T06:48:14.554799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.12943/citation-record","integrity":"/paper/2403.12943/integrity","json":"/paper/2403.12943/citation-record.json","paper":"/paper/2403.12943"},"outbound":[],"paper":{"arxiv_id":"2403.12943","last_updated":"2024-08-27T23:15:11Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:47:37Z","title":"Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 14 inbound Pith citation observations for arXiv:2403.12943."}