{"as_of":"2026-08-10T10:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0290ea174659c85e54ed613e26916aec65348a28a520b1e4857732b3321ba19d","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:30:03.258938Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05738/citation-record","integrity":"/paper/2608.05738/integrity","json":"/paper/2608.05738/citation-record.json","paper":"/paper/2608.05738"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:04.565218Z","title":"IEEE Transactions on Neural Networks and Learning Systems , year=","venue":null,"work_id":"42a05183-78a3-479a-9971-9a2326d31d61","year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.006647Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:46973bb7baa0df4b634fdf2bf326d693304224bf072c68825cbcc18513c1b297","observation_id":"f7eb6eb6-0e15-47ef-8527-cdc713ce9b0c","resolution":{"observed_at":"2026-08-08T00:30:04.570439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20100","last_updated":"2026-04-23T04:10:40Z","snapshot_observed_at":"2026-07-06T23:06:35.507008Z","submitted_at":"2026-04-22T01:51:48Z","title":"JoyAI-RA 0.1: A Foundation Model for Robotic Autonomy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.20100","snapshot_observed_at":"2026-08-08T00:30:03.014525Z","title":"arXiv preprint arXiv:2604.20100 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.014525Z"},"links":{"cited_paper":"/paper/2604.20100","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:7a100e87eb3f872c01bf313f0e3b329c73cfbbde7818c6aaf341f1f02e13cf0c","observation_id":"987ca5b0-57c6-471e-b0e4-7f1e53de1289","resolution":{"observed_at":"2026-08-08T00:30:03.014525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-08T00:30:03.020883Z","title":"arXiv preprint arXiv:2406.09246 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.020883Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:227411dc9bb974da4a92cca52505ae75560fb840065b3919a3386f1188ea9c78","observation_id":"fa45f4ed-4fb9-453b-b8b6-afb419116e19","resolution":{"observed_at":"2026-08-08T00:30:03.020883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.028302Z","title":"Proceedings of the 60th annual meeting of the association for computational linguistics (volume 1: long papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.028302Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:7067291788fdbd04119419895da38a988040c96d9b499b4977cd2d3f944b92e0","observation_id":"7082172c-ce99-4768-a7f8-66ccfcb83440","resolution":{"observed_at":"2026-08-08T00:30:03.028302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.034197Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.034197Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:97b21f66a19892640939af89bc0ec8063572645b835b5589997d6a8043406e8c","observation_id":"4ca46f22-ed91-4dab-a9d0-b77ea41e4422","resolution":{"observed_at":"2026-08-08T00:30:03.034197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-08T00:30:03.040411Z","title":"arXiv preprint arXiv:2204.01691 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.040411Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:2f27fec50b85f087698ea06b92236c1f6a5d8a0f230e5709d4b6b9994a754ec0","observation_id":"e6bbec38-f956-48dc-b36b-dec14083be3a","resolution":{"observed_at":"2026-08-08T00:30:03.040411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.047791Z","title":"2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.047791Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:48445ef7d504f355cc2519e4e193b6bb5e9c45c1f0d6a510ce7fa2363c5de7a8","observation_id":"183a0138-3ca1-4870-b752-101aba51a2c4","resolution":{"observed_at":"2026-08-08T00:30:03.047791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20289","last_updated":"2025-07-19T05:24:59Z","snapshot_observed_at":"2026-08-09T06:01:05.298875Z","submitted_at":"2025-05-26T17:59:17Z","title":"VisualToolAgent (VisTA): A Reinforcement Learning Framework for Visual Tool Selection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20289","snapshot_observed_at":"2026-08-08T00:30:03.053598Z","title":"arXiv preprint arXiv:2505.20289 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.053598Z"},"links":{"cited_paper":"/paper/2505.20289","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:52900a560eebb0c1f1c356fa76e32ce8e7b876c2c55a04c975fc75c9b32b5ee6","observation_id":"2ecdc0a2-7efb-4598-a93b-4def83e45495","resolution":{"observed_at":"2026-08-08T00:30:03.053598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:04.510924Z","title":"NeurIPS 2025 Workshop on Space in Vision, Language, and Embodied AI , year=","venue":null,"work_id":"dbcdb4d0-0c99-4375-8a64-7c04b9c2e271","year":2025},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.059312Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:fbd2f145f1a8ec1d1a4aa9ebbbdd152c3cc04d91996185fd5a9c56d742bfbc11","observation_id":"939750d8-1c9e-4f39-83ce-3080f9eb4076","resolution":{"observed_at":"2026-08-08T00:30:04.516393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:04.491929Z","title":"9th Annual Conference on Robot Learning , year=","venue":null,"work_id":"515864b6-b053-4f2c-ab1b-ad553ca14aa7","year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.064459Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:7396fde6744fdc4d62fc956554f7a7c42ceabef8100cc202da7dac6c566ea69a","observation_id":"5812d0e6-efe0-49fa-8938-448723d2313a","resolution":{"observed_at":"2026-08-08T00:30:04.498202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.19236","last_updated":"2026-01-30T13:36:22Z","snapshot_observed_at":"2026-07-06T22:19:00.152099Z","submitted_at":"2025-08-26T17:57:16Z","title":"MemoryVLA: Perceptual-Cognitive Memory in Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.19236","snapshot_observed_at":"2026-08-08T00:30:03.069585Z","title":"arXiv preprint arXiv:2508.19236 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.069585Z"},"links":{"cited_paper":"/paper/2508.19236","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:fe3736726145b6d7c7e7d260808f4e0c7ca8a81a38426310f1e1f11ed33d71ef","observation_id":"fd67b1d6-3ee6-447b-ae0b-1e4aeee59680","resolution":{"observed_at":"2026-08-08T00:30:03.069585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:04.474306Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":"046a2294-a5dc-4a1e-a8ad-5969fb81d396","year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.075063Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:41302f6fe32549bbd6db2d76366d5fdf397e6d54d9ee367d9119bbf82995ce82","observation_id":"d4782cff-fe70-40e2-962c-80cd24031efb","resolution":{"observed_at":"2026-08-08T00:30:04.479702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-08T00:30:03.081177Z","title":"arXiv preprint arXiv:2303.03378 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.081177Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:646c6b1de7bcf659b1f2c1f8bccd6a8e174fcc15565890e5d6aa307110d1d9dc","observation_id":"36f58bce-f1f6-4c18-adfe-381d103a2ba4","resolution":{"observed_at":"2026-08-08T00:30:03.081177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-08-08T00:30:03.086780Z","title":"arXiv preprint arXiv:2307.05973 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.086780Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:7a286d4ea4e28612171f0271febe63d048153f909b52e3650869771d047b4e24","observation_id":"d78a3072-537f-4a59-9a36-aa028beb1cca","resolution":{"observed_at":"2026-08-08T00:30:03.086780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05608","last_updated":"2022-07-12T15:20:48Z","snapshot_observed_at":"2026-08-08T09:48:52.583612Z","submitted_at":"2022-07-12T15:20:48Z","title":"Inner Monologue: Embodied Reasoning through Planning with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05608","snapshot_observed_at":"2026-08-08T00:30:03.092074Z","title":"arXiv preprint arXiv:2207.05608 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.092074Z"},"links":{"cited_paper":"/paper/2207.05608","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:6887be04549e41c7d41e7ac3887a43daa17d9388fe81e37e77f144f1eb2732e3","observation_id":"4170b60c-f2a6-4a5a-93d4-35a4a86896e0","resolution":{"observed_at":"2026-08-08T00:30:03.092074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.04069","last_updated":"2026-06-01T16:57:23Z","snapshot_observed_at":"2026-08-03T18:42:08.737584Z","submitted_at":"2025-12-03T18:50:04Z","title":"SpaceTools: Tool-Augmented Spatial Reasoning via Double Interactive RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.04069","snapshot_observed_at":"2026-08-08T00:30:03.097660Z","title":"arXiv preprint arXiv:2512.04069 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.097660Z"},"links":{"cited_paper":"/paper/2512.04069","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:ba3d8663d548675897a6e63d10c7e6aaa401399fd20e199ebe460d4093bb1a20","observation_id":"2b43020b-bb89-4179-b01b-d18a17b3eb1f","resolution":{"observed_at":"2026-08-08T00:30:03.097660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.13119","last_updated":"2026-05-13T07:40:34Z","snapshot_observed_at":"2026-08-01T14:15:33.557028Z","submitted_at":"2026-05-13T07:40:34Z","title":"Towards Long-horizon Embodied Agents with Tool-Aligned Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.13119","snapshot_observed_at":"2026-08-08T00:30:03.103238Z","title":"arXiv preprint arXiv:2605.13119 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.103238Z"},"links":{"cited_paper":"/paper/2605.13119","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:61f74a608018e2a798cc017799954c66a3b4b84ab28a391223818825b9039941","observation_id":"1b5ba0d2-d480-4540-a2ae-53b7041dfae8","resolution":{"observed_at":"2026-08-08T00:30:03.103238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.01166","last_updated":"2026-05-08T03:58:29Z","snapshot_observed_at":"2026-07-06T22:44:00.266269Z","submitted_at":"2026-02-01T11:34:37Z","title":"Latent Reasoning VLA: Latent Thinking and Prediction for Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.01166","snapshot_observed_at":"2026-08-08T00:30:03.108171Z","title":"arXiv preprint arXiv:2602.01166 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.108171Z"},"links":{"cited_paper":"/paper/2602.01166","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:9552202ecc51cc86fad49fa4b9ceccc5a180c0f6543100e2cbea84981cb7cb6b","observation_id":"bca905dc-e752-4eab-93fa-e195838f3fb6","resolution":{"observed_at":"2026-08-08T00:30:03.108171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:04.455342Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":"70913d4e-da53-4186-b334-3e66423e8532","year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.113661Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:0ec0d0208e3b2aeffc24a0b7c3910fd462c9137729522e6b7622b1fe3d9a4610","observation_id":"c23256b3-56ad-49d2-be2e-0c730d7a4f1a","resolution":{"observed_at":"2026-08-08T00:30:04.461262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.118707Z","title":"arXiv preprint arXiv:2601.11404 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.118707Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:f3e2bce9da235a694e73bb2011fc87d8069cef6d693431229c34dfe860ca9ddd","observation_id":"aac46958-56d6-4430-a0de-e5471dff2a8d","resolution":{"observed_at":"2026-08-08T00:30:03.118707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.123624Z","title":"arXiv preprint arXiv:2603.22280 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.123624Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:6f59c670be8583db2a2901bda5142c15ee2a7bb47a8f71b096f281c2a512534f","observation_id":"b73c236e-f001-4b65-a4e7-d42c3af9ab61","resolution":{"observed_at":"2026-08-08T00:30:03.123624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.127765Z","title":"arXiv preprint arXiv:2603.14523 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.127765Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:b245f44f394e28d51184e7e33cd9fe56ba6b60ef13b56003d58dc716d2071d0e","observation_id":"26b69c93-ab4b-4f41-87db-c949e7e991b6","resolution":{"observed_at":"2026-08-08T00:30:03.127765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.132899Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.132899Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:29356528924565664b11c645dbec78b8a86e3127ef1bf94556fef489762c0788","observation_id":"f3b75b19-ac0b-4eb3-b5f6-da0aac8eba28","resolution":{"observed_at":"2026-08-08T00:30:03.132899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-08T00:30:03.137263Z","title":"arXiv preprint arXiv:2410.24164 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.137263Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:c25b19021eaa84e13d88ea9c73cd2d965997cab19bc1fa6bc18632952d51cbb2","observation_id":"7c618703-eda2-49e8-b18e-84832367434d","resolution":{"observed_at":"2026-08-08T00:30:03.137263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13778","last_updated":"2025-10-15T17:30:05Z","snapshot_observed_at":"2026-07-06T22:32:47.087967Z","submitted_at":"2025-10-15T17:30:05Z","title":"InternVLA-M1: A Spatially Guided Vision-Language-Action Framework for Generalist Robot Policy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13778","snapshot_observed_at":"2026-08-08T00:30:03.142726Z","title":"arXiv preprint arXiv:2510.13778 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.142726Z"},"links":{"cited_paper":"/paper/2510.13778","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:5875fc8daffc10b5326b9d22663b5a221cf41f924fd321466170adc2c80a2f1e","observation_id":"d394e4ff-3465-491a-8843-6d3bfcb0ddf8","resolution":{"observed_at":"2026-08-08T00:30:03.142726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:04.428152Z","title":"Forty-third International Conference on Machine Learning , year=","venue":null,"work_id":"743da55c-a25b-4c39-9d21-a4503a37ab29","year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.147823Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:e014ebe2857c8b02a83f7ce248571aa938ebd6ce86ff5ace06770a3e494bd44d","observation_id":"b95ac65d-b420-4422-8ce7-55c7859b323a","resolution":{"observed_at":"2026-08-08T00:30:04.433143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.153249Z","title":"arXiv preprint arXiv:2602.10098 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.153249Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:093f1348c955af20df7f7565a8dfead48c539cb15dd97e1807a6805fff3bc1b4","observation_id":"37f111f6-d03b-47dc-8e04-8cffaddf19ad","resolution":{"observed_at":"2026-08-08T00:30:03.153249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:04.412456Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"9de19948-2bdf-4669-8453-d3270ea35380","year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.158542Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:c023c6e26b007d27a4e9dc75fca52b2a9480f93ef3b2f310c6b2603ab6b9ce24","observation_id":"0bb6acc2-4fcb-4a27-b008-8d0f96ce7529","resolution":{"observed_at":"2026-08-08T00:30:04.417001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-08T00:30:03.164482Z","title":"arXiv preprint arXiv:2411.19650 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.164482Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:18ce418f05512fa4676b3b31e8615f0c3ec739282b54079fda4e06c8627934dd","observation_id":"9605a5a1-b880-4e73-9d8b-a298bf1a501a","resolution":{"observed_at":"2026-08-08T00:30:03.164482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.11236","last_updated":"2026-04-14T10:01:08Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-02-11T16:47:01Z","title":"ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.11236","snapshot_observed_at":"2026-08-08T00:30:03.169903Z","title":"arXiv preprint arXiv:2602.11236 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.169903Z"},"links":{"cited_paper":"/paper/2602.11236","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:dc9c5fd3ef48db0f121a3a868fa9dbebc0c8f60c282625ecc5eec5792afd3b9a","observation_id":"53eece55-de9e-4048-9e66-99fad28bd8ea","resolution":{"observed_at":"2026-08-08T00:30:03.169903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:04.397099Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"396a1478-2158-4501-958a-d77fc6636b39","year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.176272Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:6df28d0fdf9c4961f39e68ebc2952b96cd38b8378d6f06857474fc573e4d833b","observation_id":"9bab54ad-2aea-4e55-8cc6-935a0fff07b2","resolution":{"observed_at":"2026-08-08T00:30:04.401760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.181620Z","title":"arXiv preprint arXiv:2512.16793 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.181620Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:3162adc77c814b1a90bbf7ff87f7032c6a9486c78622f7b4d3ce11e8e4a7077c","observation_id":"d26d14f8-be1c-49df-a7d1-c0eb87eb3b33","resolution":{"observed_at":"2026-08-08T00:30:03.181620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.187460Z","title":"arXiv preprint arXiv:2601.14133 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.187460Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:e5eb5a9fbb79907f58dbd4a6630c9c5a2b989476f16adc458fb431620e025916","observation_id":"d3eac13e-9ff4-4a6e-83a7-049686782f5b","resolution":{"observed_at":"2026-08-08T00:30:03.187460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.06951","last_updated":"2025-09-09T09:42:16Z","snapshot_observed_at":"2026-07-06T22:26:03.668339Z","submitted_at":"2025-09-08T17:58:30Z","title":"F1: A Vision-Language-Action Model Bridging Understanding and Generation to Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.06951","snapshot_observed_at":"2026-08-08T00:30:03.192785Z","title":"arXiv preprint arXiv:2509.06951 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.192785Z"},"links":{"cited_paper":"/paper/2509.06951","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:92002ef95550c5aa961d2f3034984e00c1be72c882a9773a3aec01a120193fa7","observation_id":"b31fc78e-0ab8-413d-a379-dc434b8a0e3f","resolution":{"observed_at":"2026-08-08T00:30:03.192785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-08T00:30:03.200006Z","title":"arXiv preprint arXiv:2501.15830 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.200006Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:ee452da85ee0c7407df67481ee0e272993752bf734b19832ec7a0467cb598dde","observation_id":"03e84617-c671-4265-959b-e2c0102bf50e","resolution":{"observed_at":"2026-08-08T00:30:03.200006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.205571Z","title":"The International Journal of Robotics Research , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.205571Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:036fccbe8686319b2a0c8b806af75823aa32e0ea04e4301a5b55a15232693319","observation_id":"cac90b40-68a7-4dc2-8389-5d728c22452b","resolution":{"observed_at":"2026-08-08T00:30:03.205571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-08T00:30:03.210982Z","title":"arXiv preprint arXiv:2503.06669 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.210982Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:bb7e61027605cb2414c59092d8fa6c6e3d31e19a8926474fb6024dd9ddcbe875","observation_id":"10af046f-e2f2-46c3-9b49-32ac84ddabd1","resolution":{"observed_at":"2026-08-08T00:30:03.210982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.216216Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.216216Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:626b5ac90977c052b5f470b9eec00572d63292ee665f7486f9a7a404f8c84ac3","observation_id":"fcabc654-5e06-4509-8f56-234e2db5dbec","resolution":{"observed_at":"2026-08-08T00:30:03.216216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.221703Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.221703Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:82c749e904db6cb29b4466adf682a3fdab903600d4c4ca22e7f90ed939bf013e","observation_id":"2eae2f62-71b2-429d-8268-38737a1f2000","resolution":{"observed_at":"2026-08-08T00:30:03.221703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-08T00:30:03.227603Z","title":"arXiv preprint arXiv:2405.05941 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.227603Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:2428b4b754625c315a894ec0cd82cf3c10e3ccb5296463aea6d31771c4709edf","observation_id":"30abe21b-8325-4def-a671-800650bead3f","resolution":{"observed_at":"2026-08-08T00:30:03.227603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-08T00:30:03.233497Z","title":"arXiv preprint arXiv:2402.03300 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.233497Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:16ba0b526c042d77c3c06d49860387ec54097afdc0a3649b7b40ee4624629cf7","observation_id":"795120de-04e2-44e3-b023-8d31416b2d23","resolution":{"observed_at":"2026-08-08T00:30:03.233497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-08T00:30:03.239113Z","title":"arXiv preprint arXiv:2503.14734 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.239113Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:f2fc397772f2a6d725eea1eb0caf2a65c8e9d4acc79201711834cec5396859b9","observation_id":"d74d6ebf-ad62-4be2-b055-f1c89be2d433","resolution":{"observed_at":"2026-08-08T00:30:03.239113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:04.340729Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":"80f09b13-7887-4bb1-851f-c66794cced5f","year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.244179Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:abc7af8597612ce944861765323ea822426bd2233277c06d0fc925bf256e8c71","observation_id":"b0d84f58-b6ef-4187-afb3-b069aafdbe19","resolution":{"observed_at":"2026-08-08T00:30:04.347498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.249206Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.249206Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:6957ffe65a00e3cd3d4ef3c20c31be9e78a1c0a907449e6bcd954028cfc0602b","observation_id":"4ac47c81-6e3d-4599-a3af-04d185bdae5f","resolution":{"observed_at":"2026-08-08T00:30:03.249206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.253931Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.253931Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:1d1276ae26a4ed442c914ee7caa66d9a41e1538d4610e2ac11e61fba906d3d2a","observation_id":"973885bc-d72e-4e38-8ea7-39073732b0bd","resolution":{"observed_at":"2026-08-08T00:30:03.253931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T00:30:03.258938Z","title":"arXiv preprint arXiv:2602.01067 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-08T00:30:03.258938Z"},"links":{"citing_paper":"/paper/2608.05738"},"observation_digest":"sha256:8f7b93b5042cf3ae84f9983ebcfe70b2d2e78b3a0b1609a3233398e8fb61bdf1","observation_id":"e9ec2099-f2a6-48dd-a2fa-c8b9eee4228f","resolution":{"observed_at":"2026-08-08T00:30:03.258938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05738","last_updated":"2026-08-06T08:21:02Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T23:11:27.174274Z","submitted_at":"2026-08-06T08:21:02Z","title":"In-Context VLA: Endowing Vision-Language-Action Models with Language via In-Context Post-Training and Agentic Tool Use"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2608.05738."}