{"as_of":"2026-08-10T03:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:695f18f946b058de38bd3cbeb570f602b27bc8c4a2cc5a389e24b1a12afc22e3","coverage":[{"denominator":98,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T16:49:11.453392Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:27:03.967235Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:28:58.449574Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12644","snapshot_observed_at":"2026-08-04T07:27:03.967235Z","title":"Vlmgineer: Vision language models as robotic toolsmiths,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.25850","last_updated":"2026-06-23T00:18:36Z","snapshot_observed_at":"2026-08-07T08:02:35.986513Z","submitted_at":"2025-10-29T18:00:16Z","title":"Debate2Create: Robot Co-design via Multi-Agent LLM Debate","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T07:27:03.967235Z"},"links":{"cited_paper":"/paper/2507.12644","citing_paper":"/paper/2510.25850"},"observation_digest":"sha256:c7adf75c0a70e8340355166afbb7ee9b713fa6acea6b3f102027ddc136a17eb0","observation_id":"5a36d9d1-4eca-4cc6-9fab-553fe9e60cac","resolution":{"observed_at":"2026-08-04T07:27:03.967235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"cited_work":{"arxiv_id":"2507.12644","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.12644","snapshot_observed_at":"2026-07-03T21:28:58.449574Z","title":null,"venue":null,"work_id":"9218fe86-20b6-44bb-b285-04a8bb08a397","year":2025},"citing_paper":{"arxiv_id":"2607.02089","last_updated":"2026-07-01T14:25:43Z","snapshot_observed_at":"2026-08-02T16:57:02.105465Z","submitted_at":"2026-07-01T14:25:43Z","title":"ESC: Emotional Self-Correction for Reliable Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-03T21:20:00.041277Z"},"links":{"cited_paper":"/paper/2507.12644","citing_paper":"/paper/2607.02089"},"observation_digest":"sha256:b548b845f4f64337425256b8d2d326295291ab72ad827a6924c113ca0440c8d0","observation_id":"8f0d6bff-d428-4b5a-9c29-b87d5974fcf6","resolution":{"observed_at":"2026-07-03T21:28:58.450872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12644","snapshot_observed_at":"2026-08-01T22:45:15.341522Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15641","last_updated":"2026-07-17T05:34:29Z","snapshot_observed_at":"2026-08-07T08:48:58.437566Z","submitted_at":"2026-07-17T05:34:29Z","title":"IMBench: A Benchmark for Intuitive Robotic Manipulation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-01T22:45:15.341522Z"},"links":{"cited_paper":"/paper/2507.12644","citing_paper":"/paper/2607.15641"},"observation_digest":"sha256:35e3405d28671001d8a8bc776b74e11e4420f05832c23c02187a90f5091f840f","observation_id":"2dfae5bd-642f-44bc-bc84-dbc00add0b77","resolution":{"observed_at":"2026-08-01T22:45:15.341522Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.12644/citation-record","integrity":"/paper/2507.12644/integrity","json":"/paper/2507.12644/citation-record.json","paper":"/paper/2507.12644"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.14447","last_updated":"2023-10-17T18:05:32Z","snapshot_observed_at":"2026-07-06T15:46:36.421593Z","submitted_at":"2023-06-26T06:30:29Z","title":"RoboCook: Long-Horizon Elasto-Plastic Object Manipulation with Diverse Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14447","snapshot_observed_at":"2026-08-06T16:48:59.301746Z","title":"Robocook: Long-horizon elasto-plastic object manipulation with diverse tools,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:59.301746Z"},"links":{"cited_paper":"/paper/2306.14447","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:e7e8610b9893615cfe0953762ab931feaf80dbeb7c9e29cb4a017fcac5953024","observation_id":"d25b8a73-ccf8-4ed1-ac51-9ea4e46466bf","resolution":{"observed_at":"2026-08-06T16:48:59.301746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:59.372081Z","title":"Learning generalizable tool-use skills through trajectory generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:59.372081Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:f74fbd87bf7c98fae1e6b394a63b03c03551e88484bd7a30e1f753d66d1fa23f","observation_id":"e66e9c00-8efd-4ffe-a29e-e21254852005","resolution":{"observed_at":"2026-08-06T16:48:59.372081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11580","last_updated":"2024-09-17T22:12:07Z","snapshot_observed_at":"2026-08-10T02:32:47.393314Z","submitted_at":"2024-09-17T22:12:07Z","title":"PLATO: Planning with LLMs and Affordances for Tool Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11580","snapshot_observed_at":"2026-08-06T16:48:59.496536Z","title":"Plato: Planning with llms and affordances for tool manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:59.496536Z"},"links":{"cited_paper":"/paper/2409.11580","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:a7c75379d0a980ed3c594e09047b26c456be3cee93f9c31f5690dc55d2472767","observation_id":"c86b2ae5-eadd-447f-90d5-0b6e114aa655","resolution":{"observed_at":"2026-08-06T16:48:59.496536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:48:59.618863Z","title":"Bimanual dexterity for complex tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:59.618863Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:63186cfe5b5976672b1dfdf98b8536cc2791765c07e284ce37d9273e5b432c79","observation_id":"b0f1d743-2aa0-4c74-935a-245e6de6c576","resolution":{"observed_at":"2026-08-06T16:48:59.618863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07884","last_updated":"2024-07-10T17:51:33Z","snapshot_observed_at":"2026-08-09T19:46:07.088323Z","submitted_at":"2024-07-10T17:51:33Z","title":"Vegetable Peeling: A Case Study in Constrained Dexterous Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07884","snapshot_observed_at":"2026-08-06T16:48:59.721796Z","title":"Vegetable peeling: A case study in constrained dexterous manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:59.721796Z"},"links":{"cited_paper":"/paper/2407.07884","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:86be20b9a145d038e72550ee198e84d16610e665994494e3362953cfcb9b12a5","observation_id":"21cfa20a-d9f0-4b05-8c8b-cf244f17a165","resolution":{"observed_at":"2026-08-06T16:48:59.721796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08647","last_updated":"2023-06-16T23:02:21Z","snapshot_observed_at":"2026-08-07T14:05:45.642543Z","submitted_at":"2023-06-14T17:27:10Z","title":"Language to Rewards for Robotic Skill Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08647","snapshot_observed_at":"2026-08-06T16:48:59.846352Z","title":"Language to rewards for robotic skill synthesis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:59.846352Z"},"links":{"cited_paper":"/paper/2306.08647","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:80017483364fd702961469785209aba07cfd3971a315c3608f462e53143869b9","observation_id":"95a92f59-0f4f-49cc-9247-4211e82f381d","resolution":{"observed_at":"2026-08-06T16:48:59.846352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12931","last_updated":"2024-04-30T21:35:53Z","snapshot_observed_at":"2026-08-02T10:40:03.816188Z","submitted_at":"2023-10-19T17:31:01Z","title":"Eureka: Human-Level Reward Design via Coding Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12931","snapshot_observed_at":"2026-08-06T16:49:00.033228Z","title":"Eureka: Human-level reward design via coding large lan- guage models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:00.033228Z"},"links":{"cited_paper":"/paper/2310.12931","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:ed60d31083ae9a0ce5021d61319bb74364e5188e7630a0c8eab4713d7d217f75","observation_id":"846a8b07-91db-45a5-9c97-6f6a7c527485","resolution":{"observed_at":"2026-08-06T16:49:00.033228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:00.170354Z","title":"Blenderalchemy: Editing 3d graphics with vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:00.170354Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:782a68b8bb8495bf045e7b1592884b772514f9133f9a038fdb8c6f88614491a3","observation_id":"d688ebd5-913a-4ca0-90dd-fa5d0f35500c","resolution":{"observed_at":"2026-08-06T16:49:00.170354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13882","last_updated":"2025-06-02T15:59:31Z","snapshot_observed_at":"2026-08-09T09:27:46.476941Z","submitted_at":"2024-10-03T19:42:16Z","title":"Articulate-Anything: Automatic Modeling of Articulated Objects via a Vision-Language Foundation Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13882","snapshot_observed_at":"2026-08-06T16:49:00.339714Z","title":"Articulate-anything: Automatic modeling of articulated objects via a vision-language foundation model,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:00.339714Z"},"links":{"cited_paper":"/paper/2410.13882","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:6dbcca93686f52ae3c27af34d05888e9703357dd85184bf5c65f655cb2ad2da8","observation_id":"33e0b914-87e9-4a4c-88b1-447ccbe3cc2c","resolution":{"observed_at":"2026-08-06T16:49:00.339714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17126","last_updated":"2024-09-25T17:42:20Z","snapshot_observed_at":"2026-07-06T19:22:14.655041Z","submitted_at":"2024-09-25T17:42:20Z","title":"Blox-Net: Generative Design-for-Robot-Assembly Using VLM Supervision, Physics Simulation, and a Robot with Reset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17126","snapshot_observed_at":"2026-08-06T16:49:00.491052Z","title":"Blox-net: Generative design-for-robot-assembly using vlm supervision, physics simulation, and a robot with reset,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:00.491052Z"},"links":{"cited_paper":"/paper/2409.17126","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:f167caf133600a4989c799b556d81ab6ac07db46bafd2be7fea478ea2faae00d","observation_id":"2a32344d-d023-48c0-99d0-5eb025a1b20c","resolution":{"observed_at":"2026-08-06T16:49:00.491052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:00.628303Z","title":"Mathematical discoveries from program search with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:00.628303Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:1ed1931ac496c6848f20e680c4f1335d80438c998127cf2d21e012912dd8abb4","observation_id":"3ca1d378-505f-4424-a8bd-b44b67eaeea5","resolution":{"observed_at":"2026-08-06T16:49:00.628303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04824","last_updated":"2024-07-01T04:48:24Z","snapshot_observed_at":"2026-08-09T19:34:01.172314Z","submitted_at":"2024-06-07T10:49:59Z","title":"FunBO: Discovering Acquisition Functions for Bayesian Optimization with FunSearch","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04824","snapshot_observed_at":"2026-08-06T16:49:00.742479Z","title":"Funbo: Discovering acquisition functions for bayesian optimization with funsearch,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:00.742479Z"},"links":{"cited_paper":"/paper/2406.04824","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:06149fb93e949f240d5c33759429e8dec8c649aa0cece5c6715a4cd911ac1219","observation_id":"1e095913-4d3e-417b-b37c-b961a6ae419e","resolution":{"observed_at":"2026-08-06T16:49:00.742479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:00.839779Z","title":"Alphaevolve: A gemini-powered coding agent for designing advanced algorithms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:00.839779Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:408424d9ab02d51460c80dc56f3eb6c2551e499b0c5d689892ca926f8114dea0","observation_id":"c4e1853d-31a0-4eaf-a524-d4c04e600dac","resolution":{"observed_at":"2026-08-06T16:49:00.839779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.00728","last_updated":"2022-02-01T19:56:39Z","snapshot_observed_at":"2026-08-09T07:29:08.439478Z","submitted_at":"2022-02-01T19:56:39Z","title":"Physical Design using Differentiable Learned Simulators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.00728","snapshot_observed_at":"2026-08-06T16:49:00.986356Z","title":"Physical design using differentiable learned simulators,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:00.986356Z"},"links":{"cited_paper":"/paper/2202.00728","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:b0645460ceec5cd1637d9a1886ad309d672c98c1cbd3292847e134ab383352b1","observation_id":"5abceab4-d58e-45a1-829d-c79b4f9367be","resolution":{"observed_at":"2026-08-06T16:49:00.986356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:01.085239Z","title":"Learning to design and construct bridge without blueprint,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:01.085239Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:298aff1a1222e16e4e1073028cd867f1922a8c5769342022dc2796a80e2e7781","observation_id":"625927cd-87f9-4b7b-a93a-fa705f0437c6","resolution":{"observed_at":"2026-08-06T16:49:01.085239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:01.229970Z","title":"Learning to design 3d printable adaptations on everyday objects for robot manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:01.229970Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:dd6aaf611cb6a69bbb48d55de021365a4f860d42eccb0b2874247d24a4c9c41d","observation_id":"9ba0ea76-2e2e-4634-8ae0-edd32f3f29d2","resolution":{"observed_at":"2026-08-06T16:49:01.229970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:01.385477Z","title":"Morph: Design co- optimization with reinforcement learning via a differ- entiable hardware model proxy,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:01.385477Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:88e890ff351575a32ccd0050b83d02583c93ef0553bfca6e8dbfc7f6e9870a09","observation_id":"c8a5b814-58cd-4bb0-9bf3-ab957fbd5a36","resolution":{"observed_at":"2026-08-06T16:49:01.385477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.13561","last_updated":"2020-10-07T04:05:19Z","snapshot_observed_at":"2026-07-06T08:25:40.950001Z","submitted_at":"2019-09-30T09:55:33Z","title":"Imagine That! Leveraging Emergent Affordances for 3D Tool Synthesis","version":4},"cited_work":{"arxiv_id":"1909.13561","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.13561","snapshot_observed_at":"2026-08-06T16:49:14.056799Z","title":"Imagine That! Leveraging Emergent Affordances for 3D Tool Synthesis","venue":"cs.LG","work_id":"e0e9caaa-370c-4cfb-b260-42d51d47b4e1","year":2019},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:01.512809Z"},"links":{"cited_paper":"/paper/1909.13561","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:3b8ef1285ae7620a08d4a6055d0a9d5004c90e17658a4265d22941ef1d7ecbc7","observation_id":"9b0be4c0-0b15-465e-a490-abfeb4f8d2e6","resolution":{"observed_at":"2026-08-06T16:49:14.160816Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:01.662046Z","title":"Fit2Form: 3D generative model for robot gripper form design,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:01.662046Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:b34a97b858e7c28860bd323cf3ba657eca96c12794b4f66e6177d1b0f7b4e34c","observation_id":"0b22dcc2-84e7-4ca5-86ff-7733fd97d214","resolution":{"observed_at":"2026-08-06T16:49:01.662046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15038","last_updated":"2025-03-28T02:09:38Z","snapshot_observed_at":"2026-08-04T23:37:48.835811Z","submitted_at":"2024-02-23T01:19:30Z","title":"Dynamics-Guided Diffusion Model for Sensor-less Robot Manipulator Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15038","snapshot_observed_at":"2026-08-06T16:49:01.780755Z","title":"Dynamics-guided diffusion model for robot manipulator design,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:01.780755Z"},"links":{"cited_paper":"/paper/2402.15038","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:d7aa1f7acf68c8d0b68b01a3601ae0aac86f02c22474f8c7f67a47c6006ed316","observation_id":"10109b48-ea89-4ab7-a0b2-e9cda17b8de2","resolution":{"observed_at":"2026-08-06T16:49:01.780755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:01.914896Z","title":"Paperbot: Learning to design real-world tools using paper,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:01.914896Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:7ab8ad892bd098eb46abd8fa75ab4240b0ed3e400897e667aadf7f81e6957aaf","observation_id":"f294d3a1-fd90-4504-8f42-2e889e8eeab0","resolution":{"observed_at":"2026-08-06T16:49:01.914896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:02.087359Z","title":"Learning tool morphology for contact-rich manipulation tasks with differentiable simulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:02.087359Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:54b567b41131175aa7c04fb121a265a10e6b496ba8a00236e03e3906ab367a5a","observation_id":"e5091c00-b6df-418c-9f6b-9b4f9941706b","resolution":{"observed_at":"2026-08-06T16:49:02.087359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:02.229041Z","title":"Lamarckian evolution of simulated modular robots,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:02.229041Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:be01cd5f9d83e50fb256b92b34817511fe28db1b2ebdb4d62c3d251c6a1221db","observation_id":"8c5a3bb9-a624-4a92-905e-30639449e40a","resolution":{"observed_at":"2026-08-06T16:49:02.229041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.13100","last_updated":"2021-02-25T18:59:21Z","snapshot_observed_at":"2026-08-09T12:10:51.845321Z","submitted_at":"2021-02-25T18:59:21Z","title":"Task-Agnostic Morphology Evolution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.13100","snapshot_observed_at":"2026-08-06T16:49:02.379268Z","title":"Task-agnostic morphology evolution,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:02.379268Z"},"links":{"cited_paper":"/paper/2102.13100","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:02350c7b7f58203cdc919c397671d0877f3e5c307e7d1ee7e654fcb52616a8dd","observation_id":"88d50946-f6c1-4b97-bc36-12d53ceb0f1e","resolution":{"observed_at":"2026-08-06T16:49:02.379268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:02.508399Z","title":"Evolution of morphology through sculpting in a voxel based robot,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:02.508399Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:84aa628f6cc374fecab48ea84ba9661f23de86979570ed1d4d6b5d3cefb124c6","observation_id":"01a2e9be-94fb-4e75-aa0e-2117de8655a3","resolution":{"observed_at":"2026-08-06T16:49:02.508399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:02.619008Z","title":"Evolving virtual creatures,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:02.619008Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:fe25186c3b55821438e49f73502278ea0dfc1729428cc86cfdce1fa47b989b1d","observation_id":"56faf17b-c761-4b31-a3cc-12ae38019318","resolution":{"observed_at":"2026-08-06T16:49:02.619008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00036","last_updated":"2023-05-31T08:57:03Z","snapshot_observed_at":"2026-07-06T15:36:07.713593Z","submitted_at":"2023-05-31T08:57:03Z","title":"Symmetry-Aware Robot Design with Structured Subgroups","version":1},"cited_work":{"arxiv_id":"2306.00036","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.00036","snapshot_observed_at":"2026-08-06T16:49:13.740578Z","title":"Symmetry-Aware Robot Design with Structured Subgroups","venue":"cs.AI","work_id":"244c4720-d728-4e8f-b079-944cdb112fc3","year":2023},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:02.783877Z"},"links":{"cited_paper":"/paper/2306.00036","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:632d07f6e3aebbea81e07b7ca9bd026ef6c0eed3694152c7056b584086a557e2","observation_id":"47f66f34-09cc-4334-889f-2fb4a0c3bd91","resolution":{"observed_at":"2026-08-06T16:49:13.911648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00462","last_updated":"2023-12-01T03:46:45Z","snapshot_observed_at":"2026-07-06T16:41:39.124080Z","submitted_at":"2023-11-01T11:56:32Z","title":"Leveraging Hyperbolic Embeddings for Coarse-to-Fine Robot Design","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00462","snapshot_observed_at":"2026-08-06T16:49:02.873234Z","title":"Leveraging hyperbolic embeddings for coarse-to-fine robot design,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:02.873234Z"},"links":{"cited_paper":"/paper/2311.00462","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:16bab2be32663253662d77f0b3607aa4b5d88cb810b641032dd94c7cd3bfac5b","observation_id":"e34e82dc-c3fe-476a-8887-55d8fd4ec8ce","resolution":{"observed_at":"2026-08-06T16:49:02.873234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:03.026066Z","title":"Task-specific design optimization and fabrication for inflated-beam soft robots with growable discrete joints,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:03.026066Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:0cd5adc863a24b8d933693338db1d87328860c423a5380aa02a74f942f0d9c0b","observation_id":"b66479b7-cae7-45ee-8136-17e608a0146d","resolution":{"observed_at":"2026-08-06T16:49:03.026066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:03.168775Z","title":"Robogrammar: graph grammar for terrain-optimized robot design,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:03.168775Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:1d15dbdc0b4c0de7e2724315435566f6bb85a89d1b434d0c2b969e5628be4c3c","observation_id":"5fb005a5-3706-4d91-bedc-9951c880ef12","resolution":{"observed_at":"2026-08-06T16:49:03.168775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05538","last_updated":"2019-04-11T05:20:57Z","snapshot_observed_at":"2026-07-06T07:45:23.367700Z","submitted_at":"2019-04-11T05:20:57Z","title":"Improvisation through Physical Understanding: Using Novel Objects as Tools with Visual Foresight","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05538","snapshot_observed_at":"2026-08-06T16:49:03.294927Z","title":"Impro- visation through physical understanding: Using novel objects as tools with visual foresight,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:03.294927Z"},"links":{"cited_paper":"/paper/1904.05538","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:f255a8165457493f5cc18b3a6780fbb3f575865adef974a91e0e5f1c3fa413c3","observation_id":"e54db5be-91f5-4959-b441-151b79805f53","resolution":{"observed_at":"2026-08-06T16:49:03.294927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:03.427367Z","title":"Rapid trial-and-error learning with simulation supports flexible tool use and physical reasoning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:03.427367Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:58ee1b915a5e4b115dc3ba3d0f337f592c98e5cb1562a1db56bd4e961bf9e8eb","observation_id":"46e6e215-dd7d-4386-a743-f9caf2a24451","resolution":{"observed_at":"2026-08-06T16:49:03.427367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10734","last_updated":"2021-03-29T19:41:24Z","snapshot_observed_at":"2026-08-05T04:09:01.551902Z","submitted_at":"2020-06-18T17:57:42Z","title":"Forward Prediction for Physical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.10734","snapshot_observed_at":"2026-08-06T16:49:03.558507Z","title":"Forward prediction for physical reasoning,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:03.558507Z"},"links":{"cited_paper":"/paper/2006.10734","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:e9114341d797af8f7ea171d3ab6e51c83e466044acb52655ad191b0ca9212fa0","observation_id":"f51581e7-a4c6-4f7e-896f-2aa584e5edab","resolution":{"observed_at":"2026-08-06T16:49:03.558507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17275","last_updated":"2022-03-31T17:59:38Z","snapshot_observed_at":"2026-07-06T12:55:27.843060Z","submitted_at":"2022-03-31T17:59:38Z","title":"DiffSkill: Skill Abstraction from Differentiable Physics for Deformable Object Manipulations with Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17275","snapshot_observed_at":"2026-08-06T16:49:03.681853Z","title":"Diffskill: Skill abstraction from differentiable physics for deformable object manipulations with tools,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:03.681853Z"},"links":{"cited_paper":"/paper/2203.17275","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:1a259080707a08a88a096e076d02ffa085d36baff1e2de8cdbdd7a46db88de2d","observation_id":"f6daa2df-c025-4c61-be63-e0e8250c03f1","resolution":{"observed_at":"2026-08-06T16:49:03.681853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:03.783473Z","title":"Planning with spatial- temporal abstraction from point clouds for deformable object manipulation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:03.783473Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:4a63a2cdd1f69c8f060485ab8b60be75d065978dee77d2215a8dc35dea3257e2","observation_id":"b3042ff0-4c01-49f9-830e-71007598ab5f","resolution":{"observed_at":"2026-08-06T16:49:03.783473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:03.923649Z","title":"Learning task-oriented grasping for tool manipulation from simulated self-supervision,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:03.923649Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:187c0433efc51edca288306db13c0ee1b06bd1bdd4b95d338b662b525232bf7b","observation_id":"d77f6d88-6d16-4d21-9780-005737556023","resolution":{"observed_at":"2026-08-06T16:49:03.923649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:27.459736Z","title":"Keto: Learning keypoint representations for tool ma- nipulation,","venue":null,"work_id":"2fbf6f18-fa95-4755-a701-33e89f9bd449","year":2020},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:04.023723Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:4c191e7ece485ef9b4c39627ffa7570862b894b0e969a705e5a46cbec65edd8d","observation_id":"f523a4ce-daa5-41fe-bcf3-f79d75c7c377","resolution":{"observed_at":"2026-08-06T16:49:27.593280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:27.213899Z","title":"A causal approach to tool affordance learning,","venue":null,"work_id":"2c249f88-5b6a-4269-8d43-be530a6cac80","year":2020},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:04.131358Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:7f1267883fab29c4f6fa7a2117f0b068e62dd5d1c2310d35b4b29c1dd709790f","observation_id":"6395eba7-fa16-4cb8-be1d-7f0409b72435","resolution":{"observed_at":"2026-08-06T16:49:27.334945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:26.904850Z","title":"Deep affordance foresight: Planning through what can be done in the future,","venue":null,"work_id":"f48a48e5-934f-4e63-b111-0a656151ff7f","year":2021},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:04.265866Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:f9a60d8d946fb4c8b0bd7cf9098b40dc1443c234087e4c2244c08bf3fec2eecc","observation_id":"7968018e-a477-4690-8eac-896d19226eb3","resolution":{"observed_at":"2026-08-06T16:49:27.026235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00359","last_updated":"2021-12-01T09:11:02Z","snapshot_observed_at":"2026-08-09T08:18:29.493767Z","submitted_at":"2021-12-01T09:11:02Z","title":"Tool as Embodiment for Recursive Manipulation","version":1},"cited_work":{"arxiv_id":"2112.00359","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.00359","snapshot_observed_at":"2026-08-06T16:49:13.399189Z","title":"Tool as Embodiment for Recursive Manipulation","venue":"cs.RO","work_id":"4400344a-9c9a-4b12-b770-dbf6c8351d01","year":2021},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:04.411949Z"},"links":{"cited_paper":"/paper/2112.00359","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:cb2052d904c8dbde9a346c0b9c45319e59ee584e42b7f967a0abbdfc71ff590f","observation_id":"d021d732-6470-46f0-8dab-8ae9c29fe719","resolution":{"observed_at":"2026-08-06T16:49:13.487084Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:26.665773Z","title":"Creative robot tool use with large language models,","venue":null,"work_id":"051d8f91-7241-4b80-be75-861181e9f23f","year":2023},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:04.537641Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:65a8c0fe0ec0b3866dc1a0ca5dd428cdad9cef5acebfe8128f396a854a536368","observation_id":"61bf62f1-a928-4f4f-aefd-254f647172b8","resolution":{"observed_at":"2026-08-06T16:49:26.781511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:26.424930Z","title":"Differentiable physics and stable modes for tool-use and manipulation planning,","venue":null,"work_id":"2f1eee60-9b3c-4d03-807f-11af83b285fd","year":2018},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:04.690264Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:60d00c41531e0ba34013e3f09dcab154092bf8fa576552f13570d0287c58ab03","observation_id":"b4746fca-64ef-4c24-8a09-b9c2fe636663","resolution":{"observed_at":"2026-08-06T16:49:26.527024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:26.154727Z","title":"Co-optimizing robot, environment, and tool design via joint manipulation planning,","venue":null,"work_id":"78050488-3cd1-488f-a453-25ceb71c9d7b","year":2021},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:04.799447Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:a6194d96c4d586eda43208ac61eb081f66aef2c7b12f2a9387d002e04b60e13e","observation_id":"52337678-843c-4dbf-b0a4-b679167929a3","resolution":{"observed_at":"2026-08-06T16:49:26.273795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:25.949200Z","title":"Curriculum-based co-design of morphology and control of voxel-based soft robots,","venue":null,"work_id":"3af4e389-5f11-4fca-b7a1-c9d125fd5bd7","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:04.914548Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:3f2cbbd55f1f78eb3f5ebc1ded585f006760c79b83b9752224bedf6d8d87d1b7","observation_id":"c64e5e3b-4dc5-4dc3-8d77-89fcf7f14e5c","resolution":{"observed_at":"2026-08-06T16:49:26.051938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:25.433519Z","title":"Preco: Enhancing generalization in co- design of modular soft robots via brain-body pre-training,","venue":null,"work_id":"6ea49724-676f-41f2-817a-2b9d3b59a73c","year":2023},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:05.168283Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:42a31bfe77d110187815ac6d164b24177f47c0efb4605589e11a7ede75b6c7f7","observation_id":"403acb33-2e97-438e-95e3-58e2d73614e5","resolution":{"observed_at":"2026-08-06T16:49:25.550350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:25.150315Z","title":"Data- efficient co-adaptation of morphology and behaviour with deep reinforcement learning,","venue":null,"work_id":"bd1596ac-a6ba-4304-837c-15ecea7b7e7f","year":2020},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:05.361889Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:c7a7422e799d2f3674bf6973ae414074daa7c3c162116e6fb249e1c645536abf","observation_id":"f6f3b34e-ad3b-4ab5-9f2a-a5dab5d6982b","resolution":{"observed_at":"2026-08-06T16:49:25.311675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.03659","last_updated":"2022-04-09T16:56:11Z","snapshot_observed_at":"2026-08-07T20:38:59.769947Z","submitted_at":"2021-10-07T17:51:05Z","title":"Transform2Act: Learning a Transform-and-Control Policy for Efficient Agent Design","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.03659","snapshot_observed_at":"2026-08-06T16:49:05.478378Z","title":"Trans- form2act: Learning a transform-and-control policy for efficient agent design,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:05.478378Z"},"links":{"cited_paper":"/paper/2110.03659","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:965418afb2e0a4120a3a2c5457176da74b7fa38ed52bf5b8790164cec0cfb3d0","observation_id":"22976eca-7f85-4581-b8e6-a5df29a29373","resolution":{"observed_at":"2026-08-06T16:49:05.478378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:24.818836Z","title":"Learning-in-the-loop optimization: End-to-end control and co-design of soft robots through learned deep latent representations,","venue":null,"work_id":"58a37176-bddb-4be2-b941-aa09a1547535","year":2019},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:05.580101Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:ea36e94d27b0442fa0813c4f9f52716b66318fed434c42cd811fdf1738678705","observation_id":"044918d7-e6fb-4c3b-9410-384a9c11d712","resolution":{"observed_at":"2026-08-06T16:49:24.997689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:24.588928Z","title":"Scalable co-optimization of morphology and control in embodied machines,","venue":null,"work_id":"85438d3c-5702-4923-b240-da0fb9478c11","year":2018},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:05.674550Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:a467b70d5bebf1f408f76514c6966c88b493eeeca6a57944dffb910fb15d8f70","observation_id":"0947eed4-fb6b-4a76-9e68-44c2cf65b77c","resolution":{"observed_at":"2026-08-06T16:49:24.689316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09231","last_updated":"2024-02-14T15:21:17Z","snapshot_observed_at":"2026-08-09T14:00:49.556088Z","submitted_at":"2024-02-14T15:21:17Z","title":"Investigating Premature Convergence in Co-optimization of Morphology and Control in Evolved Virtual Soft Robots","version":1},"cited_work":{"arxiv_id":"2402.09231","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.09231","snapshot_observed_at":"2026-08-06T16:49:13.152709Z","title":"Investigating Premature Convergence in Co-optimization of Morphology and Control in Evolved Virtual Soft Robots","venue":"cs.RO","work_id":"34105f1c-840b-4842-abd7-4d75ac077da4","year":2024},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:05.758702Z"},"links":{"cited_paper":"/paper/2402.09231","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:684c391d5b4790ae2d788e5c8fcb6508b96db6e30ac3ace261b287263736009b","observation_id":"204277f2-3557-4101-b776-45862fde1f5e","resolution":{"observed_at":"2026-08-06T16:49:13.266611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19963","last_updated":"2025-02-26T02:47:08Z","snapshot_observed_at":"2026-08-09T20:12:53.544724Z","submitted_at":"2024-06-28T14:51:01Z","title":"Text2Robot: Evolutionary Robot Design from Text Descriptions","version":3},"cited_work":{"arxiv_id":"2406.19963","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.19963","snapshot_observed_at":"2026-08-06T16:49:12.931049Z","title":"Text2Robot: Evolutionary Robot Design from Text Descriptions","venue":"cs.RO","work_id":"da58350c-f467-44fa-970f-16c69c9e09af","year":2024},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:05.865537Z"},"links":{"cited_paper":"/paper/2406.19963","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:8f23ef438872ccebbf6ab8fba6362f4f0453f628e95db0b9af593b9444a8d7ac","observation_id":"10974d44-aeb7-4546-85fc-9ecf662256da","resolution":{"observed_at":"2026-08-06T16:49:13.028035Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:24.306088Z","title":"Data-efficient learning of morphology and controller for a microrobot,","venue":null,"work_id":"5f4cb534-31f3-41b8-ab9e-8a1dfbf057e2","year":2019},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:05.968965Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:073413819793f19a7935ff09739049acb5d8271b4280e0f3114d2cdf512be258","observation_id":"e3dbffee-198e-4d88-b773-296ed31a75b7","resolution":{"observed_at":"2026-08-06T16:49:24.455401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:24.011647Z","title":"Jointly learning to construct and control agents using deep reinforcement learning,","venue":null,"work_id":"4898cfbd-526d-487f-8d10-94351ccf6f3d","year":2019},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:06.052312Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:2b09f9f9409cc83454614be2f1d31985ed055ff1a7b8a96830a1482938236866","observation_id":"2fc4a558-2761-4e45-8520-bd72fdb011c8","resolution":{"observed_at":"2026-08-06T16:49:24.174562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:23.778115Z","title":"Reinforcement learning for improving agent design,","venue":null,"work_id":"360c0ca6-6af2-448b-a26e-dc2ebfc19592","year":2019},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:06.174676Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:ee7bb80337ba936b8cc1f34b81bcefde8dd3084a7a5fd72c47d27b88d682cf86","observation_id":"c605db0d-f5dd-40f8-a665-2b61aa5c1ae6","resolution":{"observed_at":"2026-08-06T16:49:23.921908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:23.461376Z","title":"Evolution gym: A large-scale benchmark for evolving soft robots,","venue":null,"work_id":"1f5fb41a-cb8b-4b71-b24b-2d0620929032","year":2021},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:06.300675Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:15f9e1aa6723ee4638eb65252e8565cf428b0ff5af7e41d20285cb862b9d3cfb","observation_id":"54d87ad4-fc22-4b81-b967-e9acf68a2607","resolution":{"observed_at":"2026-08-06T16:49:23.599392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:23.199839Z","title":"Learning to control self-assembling morphologies: a study of generalization via modularity,","venue":null,"work_id":"3e27b622-548a-4635-bf50-bc8bdebe8fe4","year":2019},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:06.466831Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:07ed317f6f6681e685576a5a4371f71ce5708cd7da9fed155516d44fc8d70555","observation_id":"324a1344-4c59-43cf-b88a-dd798633d18b","resolution":{"observed_at":"2026-08-06T16:49:23.336408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.04460","last_updated":"2020-11-09T16:45:32Z","snapshot_observed_at":"2026-08-09T09:32:19.536383Z","submitted_at":"2020-08-11T00:10:44Z","title":"Hardware as Policy: Mechanical and Computational Co-Optimization using Deep Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2008.04460","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.04460","snapshot_observed_at":"2026-08-06T16:49:12.678338Z","title":"Hardware as Policy: Mechanical and Computational Co-Optimization using Deep Reinforcement Learning","venue":"cs.RO","work_id":"0f08c634-1612-4d87-91c8-c6b66b702026","year":2020},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:06.567709Z"},"links":{"cited_paper":"/paper/2008.04460","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:c18b7950cf8c8867a065fd8f80f534b4e37dbfa2e64dc05b57c5e5e7f4c1029e","observation_id":"f7fe9dd4-b8e4-423e-b55f-0131f5af2c41","resolution":{"observed_at":"2026-08-06T16:49:12.781832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.00754","last_updated":"2023-11-01T18:00:10Z","snapshot_observed_at":"2026-07-06T16:41:51.334062Z","submitted_at":"2023-11-01T18:00:10Z","title":"Learning to Design and Use Tools for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.00754","snapshot_observed_at":"2026-08-06T16:49:06.690179Z","title":"Learning to design and use tools for robotic manipulation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:06.690179Z"},"links":{"cited_paper":"/paper/2311.00754","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:a820d7215efaf3bbdc94d91d9b5812948e1067f76a060668d29a71d63be83a6b","observation_id":"df00f0ad-600b-4ac7-aad0-8f37f3e2e406","resolution":{"observed_at":"2026-08-06T16:49:06.690179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:06.813108Z","title":"An end-to-end differentiable framework for contact-aware robot design,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:06.813108Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:328bcb2e9e0ac671519118e0d87b37d54b09c45ef1defa0294dc8e11686557cf","observation_id":"4badcd13-6519-4792-8b94-5fb37efe6079","resolution":{"observed_at":"2026-08-06T16:49:06.813108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:22.960290Z","title":"Tool shape optimization through backpropagation of neural network,","venue":null,"work_id":"a512da94-ecae-4996-bea0-c94ba105f0e8","year":2020},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:06.962058Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:77f15fb05d0925007a1a401a44fe9a0ff1bf7e517181d27f95a585481826817e","observation_id":"426f1353-7cc4-47e1-acb9-5c5b51e69f19","resolution":{"observed_at":"2026-08-06T16:49:23.074508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:07.097477Z","title":"Robomorph: Evolving robot morphology using large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:07.097477Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:fcfb7b7a38b8cfa492466eccac287ed6c9211b2ce95b27fdde97d6b9aafab31f","observation_id":"f5de6a4d-89df-43eb-9549-fad8b7e9a63c","resolution":{"observed_at":"2026-08-06T16:49:07.097477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.02249","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:12.323904Z","title":"Large language models as natural selector for embodied soft robot design,","venue":null,"work_id":"cc25c428-7795-41c4-85ee-2f8f2e1b87ba","year":2025},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:07.245686Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:a22634ec91b5a284c9e4a646f7c0fce1b2e4baa911b16a342e6db1e3c9b1a77a","observation_id":"38429a61-bef4-4936-9ebe-22758aeeb4bc","resolution":{"observed_at":"2026-08-06T16:49:12.436796Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:22.675932Z","title":"Laser: Towards diversified and generalizable robot design with large language models,","venue":null,"work_id":"4c73d581-eb8c-4e94-af1e-44ea47f92b8a","year":2025},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:07.363438Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:6332f501d2b6197c7076f32b727c6dd66c23c98f70afd8eec989418ca171d219","observation_id":"fd927a07-c1d4-4236-97d7-ca12e02870ca","resolution":{"observed_at":"2026-08-06T16:49:22.833893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:22.364524Z","title":null,"venue":null,"work_id":"42791c62-0ee3-4e27-a0af-f158d7bfff69","year":2013},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:07.456825Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:bc46d3d159519a8bfd5f2923a4e71b8edbc01049e05b7247dda5853382e98992","observation_id":"362badf0-b07c-45cc-89ed-d292beb2e00c","resolution":{"observed_at":"2026-08-06T16:49:22.529813Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:22.063359Z","title":"Evolutionary robotics: what, why, and where to,","venue":null,"work_id":"b0e5f68b-a5cd-4ddb-b6ad-29db70259909","year":2015},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:07.558592Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:8b9a08601ec1e7a3e6a67961001b60fc426b21194e95f2601b537736e7ec0cc6","observation_id":"d78b8be0-03d2-46fd-bd9c-f11921d26831","resolution":{"observed_at":"2026-08-06T16:49:22.197998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.10638","last_updated":"2020-08-24T18:16:31Z","snapshot_observed_at":"2026-08-03T04:20:30.255339Z","submitted_at":"2020-08-24T18:16:31Z","title":"Tool Macgyvering: A Novel Framework for Combining Tool Substitution and Construction","version":1},"cited_work":{"arxiv_id":"2008.10638","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.10638","snapshot_observed_at":"2026-08-06T16:49:11.904279Z","title":"Tool Macgyvering: A Novel Framework for Combining Tool Substitution and Construction","venue":"cs.RO","work_id":"26c97ee5-1338-4347-834a-ac04b577aee5","year":2020},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:07.701594Z"},"links":{"cited_paper":"/paper/2008.10638","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:50dba8cca73f5973d32ac7e823fb938bd9c60c7fefcb2833e57525af9a8bb859","observation_id":"356814a6-2256-4d55-a1b9-cf93afc43e83","resolution":{"observed_at":"2026-08-06T16:49:12.038788Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.07635","last_updated":"2018-07-24T21:22:57Z","snapshot_observed_at":"2026-07-06T06:29:20.394058Z","submitted_at":"2018-03-20T20:16:18Z","title":"Learning Robotic Assembly from CAD","version":2},"cited_work":{"arxiv_id":"1803.07635","doi":null,"metadata_source":"pith","pith_arxiv_id":"1803.07635","snapshot_observed_at":"2026-08-06T16:49:11.628740Z","title":"Learning Robotic Assembly from CAD","venue":"cs.RO","work_id":"93b74096-3d4b-4df1-b3a9-5eae4b4ca2d4","year":2018},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:07.791653Z"},"links":{"cited_paper":"/paper/1803.07635","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:df015d1f1c9167d70e066a323a0b47028244b34ca97972439e3e6645157927ad","observation_id":"16b824e1-624f-4183-8ebc-087e70412a56","resolution":{"observed_at":"2026-08-06T16:49:11.715824Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:21.740318Z","title":"Keypoint action tokens enable in-context imitation learning in robotics,","venue":null,"work_id":"1aae7850-6711-4ce8-b25e-dbdde7f72eb3","year":2024},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:07.895385Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:f91465b4ae64c57e75a9d2f9eca7c563a32034cbf264eae3cd9d16d8b8315f32","observation_id":"a2b33b16-3a01-4f3f-a0a8-9f613e9f3d0f","resolution":{"observed_at":"2026-08-06T16:49:21.901229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:21.489816Z","title":"In-context learning enables robot action prediction in llms,","venue":null,"work_id":"9c25724f-1ac7-4568-9343-83af87677eab","year":2025},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:08.033898Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:e808ce2321dada21b01df0ceb8ef3564583e982390de844d7d73853a1a1b9560","observation_id":"ba32f05d-1ba0-4b6d-abab-9de6bc78abff","resolution":{"observed_at":"2026-08-06T16:49:21.614330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:21.234008Z","title":"Rlbench: The robot learning benchmark & learning environment,","venue":null,"work_id":"04b1d192-6d55-443d-9d13-9764ba6a5ad8","year":2020},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:08.153931Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:91f76b394400181bc7448f9304e46b7373bcd45f84155f8c944c9c246724b29a","observation_id":"bc382377-857b-47a5-a3bb-d104da713798","resolution":{"observed_at":"2026-08-06T16:49:21.351590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:21.013199Z","title":"A novel tool-use mode in animals: New caledonian crows insert tools to transport objects,","venue":null,"work_id":"af800101-6fc6-4367-a64c-f2fdbe01709b","year":2016},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:08.277049Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:6708fdb40f37b297998d788c4f28de103f65f69696c75a799b73849f7aa9dcbe","observation_id":"5af18f38-a063-456f-b883-b0fb6b0af3c8","resolution":{"observed_at":"2026-08-06T16:49:21.112900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:20.765458Z","title":"Pybullet gymperium,","venue":null,"work_id":"228db770-8799-4e8b-b4c4-801deed178b0","year":2018},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:08.415993Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:b94e189daf97232cdf8f5ef18709561ac40e67630c8440826c990f9b5eeb7478","observation_id":"98220187-89e6-4f42-bcd2-ba3323e85d72","resolution":{"observed_at":"2026-08-06T16:49:20.883748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:20.510980Z","title":"SAPIEN: A simulated part-based interactive environment,","venue":null,"work_id":"609dfeee-4285-4481-bdef-5e36a18e8be7","year":2020},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:08.537676Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:0022634da25688da6bd4d71eaf50d1223cb5b5773ed408ee96101fa04c024b5c","observation_id":"c73bf97e-230a-4c92-973f-5734b2952ec7","resolution":{"observed_at":"2026-08-06T16:49:20.648599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:20.284132Z","title":"Benchmarking in manipulation re- search: Using the Yale-CMU-Berkeley object and model set,","venue":null,"work_id":"ff5556d1-0a9d-4759-ac7a-ad8c31432cd1","year":2015},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:08.601274Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:e848b70dd84878426f706c2252cf2764d830880d113dd45e184699afa9a78ead","observation_id":"eca33180-45de-48c2-8612-84ce63720c52","resolution":{"observed_at":"2026-08-06T16:49:20.397139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10897","last_updated":"2021-06-14T18:45:16Z","snapshot_observed_at":"2026-07-06T08:31:50.962710Z","submitted_at":"2019-10-24T03:19:46Z","title":"Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10897","snapshot_observed_at":"2026-08-06T16:49:08.722732Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:08.722732Z"},"links":{"cited_paper":"/paper/1910.10897","citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:da18749f1b5f0498867f0b3c161888617525804abb608f606ab486c3fc79baa0","observation_id":"914a5390-5546-4116-a704-24b43d785c39","resolution":{"observed_at":"2026-08-06T16:49:08.722732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:19.981592Z","title":"(ii) Participants then had five minutes to write a prompt in English specifying their desired tool design and robot action","venue":null,"work_id":"006e1031-82d3-4af9-a60a-40eba7a73f9f","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:08.801231Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:79d4d865315c73239219fd417a68b18666b1bb6e5240e35e0a81fadd46d33019","observation_id":"43ac7e9d-67c6-4c4a-aadd-c71befc067a1","resolution":{"observed_at":"2026-08-06T16:49:20.106659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:19.739895Z","title":null,"venue":null,"work_id":"6e56ec81-0604-4068-a823-c6bc5449ab7f","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:08.876346Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:a235bf93fa0a436049072913b822a6c1ae3e7cd83c3905d38f7995a7a86a4781","observation_id":"91d6a3f1-d575-4415-9450-e52af209d453","resolution":{"observed_at":"2026-08-06T16:49:19.857108Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:19.486337Z","title":"distance-to-exit","venue":null,"work_id":"a38befd1-10f3-4cad-86b1-183d0392cee5","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:09.039619Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:07d53a84583911bb04bc843d3dc7ae2610952a7bef488a9190bfb77babacbc08","observation_id":"a2b685e7-90e3-4597-9d0e-c608da695210","resolution":{"observed_at":"2026-08-06T16:49:19.597277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:19.220811Z","title":"The design agent is provided with task context as illustrated in Fig","venue":null,"work_id":"96782621-8b02-4677-96d0-668ea5df8e0a","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:09.100504Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:9c13848d31a3804f3141ea2924df7bdc5abffb7f16c3bdd87c0d16dbcbf6ea98","observation_id":"a641f0b2-c75c-496f-bf86-3466350b80a6","resolution":{"observed_at":"2026-08-06T16:49:19.362273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:18.951558Z","title":"For each agent, we prompt it to generate ntool number of tool designs, and naction number of action waypoint samples that correspond to each tool design","venue":null,"work_id":"d502dcc0-8ef1-4b13-8ab1-2d2b5896fb31","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:09.159826Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:a8ce3b6bc2590223c259b71ec280539abaf36b260d9a1d95e8d7eb6a3c4c84b5","observation_id":"45aed25e-4f59-420d-ba82-0a454e170b37","resolution":{"observed_at":"2026-08-06T16:49:19.067976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:18.695741Z","title":"virtual joint","venue":null,"work_id":"f39c80b7-0828-4613-8caf-cd7472ca3eb6","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:09.292009Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:36a5b757a812e1398ded87067288dc00174b4d36f63be92880b1f231cba49744","observation_id":"02ffad2b-aa47-4bce-a01b-0c2bd4c0da04","resolution":{"observed_at":"2026-08-06T16:49:18.806904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:18.444078Z","title":null,"venue":null,"work_id":"c80c7af6-d58b-4120-aeee-f292aa3f3d31","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:09.421705Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:3ad9fabc13fddb515da3e3a24071cd6f989badb08fbc90f33fc8e6a1b19b5c8b","observation_id":"64bab6c8-38b3-4762-bfa3-f5acf6cd6ec2","resolution":{"observed_at":"2026-08-06T16:49:18.568007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:18.130161Z","title":"evolution mission introduction prompt","venue":null,"work_id":"c7db3ea7-cf56-4588-bf15-77e6b95441a0","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:09.563220Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:151f1bd426f5ccc35c18a78f5a5f93995a8af01652b2a0a7a85d80c3e661e9fb","observation_id":"dfa9d619-b907-42bf-891b-aa7dfee225f8","resolution":{"observed_at":"2026-08-06T16:49:18.274399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:17.874276Z","title":null,"venue":null,"work_id":"cbd96ebe-8f1f-4f43-83ed-2ecbb44fd1aa","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:09.686796Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:a621d62079e4188ae3246b3732714e9a70500983f378534503b4f1c480cbfbba","observation_id":"b98b655c-6e2d-4a84-b895-f5f81b1053ae","resolution":{"observed_at":"2026-08-06T16:49:17.999949Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:17.555676Z","title":"Evolutionary Process","venue":null,"work_id":"6b6bdfc5-4416-45b9-a575-ed151840e576","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:09.881972Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:3a680c1691c5998ec5623c8615c5ab8c38b89f821fec9bac28532f8c6c5e836c","observation_id":"1f9631ce-e40e-40dd-b88c-987a656737ac","resolution":{"observed_at":"2026-08-06T16:49:17.674245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:17.262572Z","title":null,"venue":null,"work_id":"0985399b-22c3-4ded-b243-a5625516be45","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:10.002181Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:b0219a01fdb36ea79c6f345fe6d2a744c9d619f9c0ff9e06689f89d0d6fa363a","observation_id":"49091bee-0e58-4d75-a2a9-bc697ed3dee4","resolution":{"observed_at":"2026-08-06T16:49:17.404147Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:16.969319Z","title":null,"venue":null,"work_id":"24dd6889-2fac-4bce-96b5-3e5ac67f0883","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:10.129690Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:1be58ad03f6e86a825b6ee1b58532657cb2712eb0f38192e8b7566739718e9b9","observation_id":"d0dc1e75-cc61-4615-ae5e-5b5fe2f27d6f","resolution":{"observed_at":"2026-08-06T16:49:17.088656Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:16.719971Z","title":"Write down the spatial relationship, including by not limited to the position, orientation, dimension, and geometry of all the objects in the scene","venue":null,"work_id":"6fa96219-d843-4219-9462-9e6e069e958d","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:10.248561Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:1061ac5b3ca4ba55038cc692fe7b7bad54e7f165573157b10add6ee888041525","observation_id":"c9050439-928b-48d9-9841-9e64b46e0b8f","resolution":{"observed_at":"2026-08-06T16:49:16.836125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:16.485282Z","title":"Tool Specification","venue":null,"work_id":"93a68f50-dfd8-4bfe-a612-38fbfeea4b7e","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:10.378396Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:64926760b2713fc5a10e83138a221b956d4f046fb429b43debafc78045dee974","observation_id":"b081c908-a68b-455f-b4ce-dc6f0c956934","resolution":{"observed_at":"2026-08-06T16:49:16.569212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:16.160967Z","title":"panda_virtual","venue":null,"work_id":"04d6f92e-5374-4ddc-a155-809d966dd795","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:10.480554Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:e7ff37bae36ef267af099e9e6192a3d65dc6d47625f6844599593843d880b94b","observation_id":"723baa9c-8fc4-4c86-93b6-acbb74b91284","resolution":{"observed_at":"2026-08-06T16:49:16.278517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:15.884173Z","title":"panda_virtual","venue":null,"work_id":"7e73c9f8-28f0-4bd9-a0f1-95e6061b389a","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:10.635928Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:64fab7825d088c4d0c6a671944346324a78f5b9111c880f2b2c3228c8fe702fe","observation_id":"673441b1-7038-4e8a-a045-1952ad080f92","resolution":{"observed_at":"2026-08-06T16:49:16.006208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:15.630150Z","title":"action set","venue":null,"work_id":"451bb87c-70b7-4335-99c4-6ac038942e69","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:10.826785Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:8ff3326503a4afe44f242e9efe76508acebf716c9c432839cfcb287259aff0ed","observation_id":"78a17703-189f-4470-a775-71e14533e9de","resolution":{"observed_at":"2026-08-06T16:49:15.728226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:15.402733Z","title":"Negative x: Towards the back of the table","venue":null,"work_id":"a2ff0c51-a66f-4e6d-b691-fb6abb569359","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:10.912853Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:ad3cce1e8d1a9024476df30c7f5c33a7acbb15fd86377e1ebc1dfb431e756e36","observation_id":"0299c7bf-6df7-4b87-a462-8d4222b2bebd","resolution":{"observed_at":"2026-08-06T16:49:15.507964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:15.136599Z","title":"For each of the ntool tool designs, you can choose to either mutate or crossover","venue":null,"work_id":"e8719a62-a393-479b-9510-8228df868a9f","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:11.031635Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:ee3b61488076c79447bb0412ae2558d71a0b14f3d3a13bbc5755628f842fef40","observation_id":"84b99411-d987-43c0-ae92-c1a868788b86","resolution":{"observed_at":"2026-08-06T16:49:15.252606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:14.902856Z","title":"You operate with boldness and brilliance in the physical realm","venue":null,"work_id":"ea945dd8-cd82-4cbe-9138-148ed9d653b6","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:11.155599Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:76776c57f7643a176bfcdb9fbfa375e0c64d69fbc439958c2b325ebecedbf99b","observation_id":"3da68d78-57c6-4be8-adf6-52c106fe916b","resolution":{"observed_at":"2026-08-06T16:49:15.002788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:14.622545Z","title":"You have a robot arm that sits in the origin of your environment","venue":null,"work_id":"66bb4afd-7506-412c-8950-262d5fe539f2","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:11.311621Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:5f248f7e3122cae5c96c4f03d7ccd6fad16b4dd22c67153f7e6c66bb61631e47","observation_id":"129e11db-f3b9-46a3-a0f1-d0cdfdc30d80","resolution":{"observed_at":"2026-08-06T16:49:14.757027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:14.411270Z","title":"Royalty Free No Ai License","venue":null,"work_id":"020399f8-b19c-484c-b699-d4a09c016f20","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:11.453392Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:468cc79772918b1d13275735a37befe39e83dfe32dce6f6fa63d0a1c27df31d9","observation_id":"bf37ed33-f3a4-4823-8bbe-ec74e04baa6c","resolution":{"observed_at":"2026-08-06T16:49:14.516607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T16:49:25.677963Z","title":"Available: https://openreview.net/forum? id=r9fX833CsuN","venue":null,"work_id":"40d062ea-ee72-49b8-9599-adf13eae61a5","year":null},"citing_paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T16:49:05.034241Z"},"links":{"citing_paper":"/paper/2507.12644"},"observation_digest":"sha256:d74ae839befdde7e826ba74f505ea00ce6fae7a657e6c8ce5fe87152b7b4cd1f","observation_id":"7f73dd0c-b826-42e3-8385-32ae6407c214","resolution":{"observed_at":"2026-08-06T16:49:25.805017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.12644","last_updated":"2025-07-16T21:30:05Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T14:06:21.459730Z","submitted_at":"2025-07-16T21:30:05Z","title":"VLMgineer: Vision Language Models as Robotic Toolsmiths"},"reference_resolution":{"displayed":98,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":9,"verified_fuzzy":44},"total_outbound_references":98},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 3 inbound Pith citation observations for arXiv:2507.12644."}