{"as_of":"2026-08-09T18:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:62bbdeb2615cb31bee59b56cf56de0b813a1e1dcbde9b79e97026dca3a481728","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:21:24.869616Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.08903/citation-record","integrity":"/paper/2502.08903/integrity","json":"/paper/2502.08903/citation-record.json","paper":"/paper/2502.08903"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.753656Z","title":"Embodied intelligence toward future smart manufacturing in the era of ai foundation model,","venue":null,"work_id":"72cdebc3-61c8-4079-9c80-c4443903ef51","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.633975Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:2ce6f312c5b91410584a175f099d509419367b93311ecb7142b90d1632f0d905","observation_id":"99e568e2-f83f-431d-ace4-4ad52797d845","resolution":{"observed_at":"2026-08-07T23:21:25.759129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:24.640204Z","title":"Navigating industry 5.0: A survey of key enabling technologies, trends, challenges, and opportunities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.640204Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:6ec0387992bb8ab6e65df032f32a5c605e11297a423df04d4913c3e10dcbfc15","observation_id":"51c0a5fc-055d-4859-a414-5c75c9b916ca","resolution":{"observed_at":"2026-08-07T23:21:24.640204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.728247Z","title":"Advanced manufacturing in industry 5.0: A survey of key enabling technologies and future trends,","venue":null,"work_id":"e0975bdf-800c-47cf-beff-1ea655a9b167","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.645694Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:5312cb401e94a8a9980abf06c765fa70a05fa3af62ecd5fce65fd4ca5a61ff34","observation_id":"3465b0df-345b-40e3-aa67-d38d2d3b8a89","resolution":{"observed_at":"2026-08-07T23:21:25.733182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.711603Z","title":"Large language models for human-robot interaction: A review,","venue":null,"work_id":"c01a09f1-771b-4f8b-9a9d-3f1f117b3401","year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.651712Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:30e33508ac670716c599729c93613386cc9d597055b7c60d73d866c3f9598bfe","observation_id":"3a4efae1-1a48-41ea-977e-ed6aa77142a7","resolution":{"observed_at":"2026-08-07T23:21:25.716684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:24.657401Z","title":"A survey of optimization-based task and motion planning: From classical to learning approaches,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.657401Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:8f4ccab1164d16f4bdd11bbe919a0dc8f2d4f3296c3d53b43293d84c70329726","observation_id":"de8fb097-6b20-4673-a04d-64a6d8db1463","resolution":{"observed_at":"2026-08-07T23:21:24.657401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.669248Z","title":"Computer vision techniques in manufacturing,","venue":null,"work_id":"0ad61325-0163-4dcd-8f28-47c2a7dac47b","year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.669227Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:ddbcb4cf71473350ba25048a2183254e72edda6220addd571b6294d7c4586868","observation_id":"53084b09-2c62-47f4-9372-1669815f2edb","resolution":{"observed_at":"2026-08-07T23:21:25.674499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.653090Z","title":"A comprehen- sive study of 3-d vision-based robot manipulation,","venue":null,"work_id":"7a981b6a-2603-4619-b727-2cecaa5e2a07","year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.675049Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:2242d2879ac4e444d543c859044170a2fca7d16c5fffe713bbb0abc66ba8cdfa","observation_id":"203fdb2d-1d6c-4b6d-9f3c-88b732fd39f0","resolution":{"observed_at":"2026-08-07T23:21:25.658425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.685174Z","title":"Multi-modal 3d object detection in autonomous driving: A survey and taxonomy,","venue":null,"work_id":"74996e64-6976-4b3b-9e07-b7ad8cd4ddc4","year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.680327Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:7a5b4ab3c79c217afd41e7322be309266e59956107cfa95802587cda640170ca","observation_id":"e7c61138-a666-4cd9-a763-4f3da896d222","resolution":{"observed_at":"2026-08-07T23:21:25.690542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.636827Z","title":"Human–robot object handover: Recent progress and future direction,","venue":null,"work_id":"e47838df-3b97-4544-b860-8a7a3abfbc04","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.685653Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:c86e0865642576a21a9e3836757e4c439fed2972eddcf0a3f762c9287aeb6b3a","observation_id":"05b98e09-6909-461a-9135-c48742e77be7","resolution":{"observed_at":"2026-08-07T23:21:25.642300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:24.690968Z","title":"Cmx: Cross-modal fusion for rgb-x semantic segmentation with transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.690968Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:9659858fc6381f81dc0a12a1aa815772c7d9036155cc928da69485fdb53d4827","observation_id":"c4234f14-6199-41d4-82f7-9f2161be8ee2","resolution":{"observed_at":"2026-08-07T23:21:24.690968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.609954Z","title":"Multi-modal feature constraint based tightly coupled monocular visual-lidar odometry and mapping,","venue":null,"work_id":"1b97022f-e074-4765-b142-5679c7320253","year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.696367Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:bafef5efd60cad4008a6b2b5840a676e5f9418e100224de2de9762b388fe891e","observation_id":"7f89dc9b-5cce-4541-9531-f593264bf14a","resolution":{"observed_at":"2026-08-07T23:21:25.615825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.593061Z","title":"Llm-bt: Performing robotic adaptive tasks based on large language models and behavior trees,","venue":null,"work_id":"0c8bb0a4-dd69-4031-8234-d076fc3b7037","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.701794Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:054a418954cb2907f375b4624a72d88de0d47b615ad480f53010ffd499700d6d","observation_id":"b6a33347-4d35-4141-b73d-4c17fe331785","resolution":{"observed_at":"2026-08-07T23:21:25.598148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.576954Z","title":"Ll3da: Visual interactive instruction tuning for omni-3d understanding, reasoning, and planning,","venue":null,"work_id":"e0bd93b1-98c6-4c82-aaf9-f2a5eb21ee14","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.706864Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:9d7b740bd53dc027f9beb8620cfcf29d9ebfa610d001e237799ea3ad6d4eeb0a","observation_id":"2506b0b2-1379-4d9c-8689-affbe82a38dc","resolution":{"observed_at":"2026-08-07T23:21:25.582169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:24.716904Z","title":"Drivegpt4: Interpretable end-to-end autonomous driving via large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.716904Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:165f3154930155ea743337ac6c9227216b185722e0377bbc6412303958f0eb9d","observation_id":"be13511d-bc3e-45a3-b473-7bd3ed7a2c0f","resolution":{"observed_at":"2026-08-07T23:21:24.716904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:24.721994Z","title":"Progprompt: Generating situated robot task plans using large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.721994Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:456dc8093fec262e7fba5bbcf87f353399284f6b9795ca29e1b4ed0be11815ad","observation_id":"c23206f2-6fca-46f8-9667-86428a6b30aa","resolution":{"observed_at":"2026-08-07T23:21:24.721994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.524838Z","title":"3d- llm: injecting the 3d world into large language models,","venue":null,"work_id":"d639f8f5-368c-4b43-99f6-04e0c5a8aa97","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.727041Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:a8142e386bdcd0721ca544c60f8d2b8bb2d6ecde10a03cac7067ad3a12d7ff54","observation_id":"8b45d3cb-8d91-4180-a3d5-ed4b7341ddf9","resolution":{"observed_at":"2026-08-07T23:21:25.530677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07422","last_updated":"2025-02-13T09:32:44Z","snapshot_observed_at":"2026-07-06T19:00:35.877802Z","submitted_at":"2024-08-14T10:00:16Z","title":"LLMI3D: MLLM-based 3D Perception from a Single 2D Image","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07422","snapshot_observed_at":"2026-08-07T23:21:24.732040Z","title":"Llmi3d: Empowering llm with 3d perception from a single 2d image,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.732040Z"},"links":{"cited_paper":"/paper/2408.07422","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:42b1c79e4dee5a994be4bdaf596eb6cb239b4197dd79b577c24284ef33c18a7d","observation_id":"9f79243e-13d3-4c04-bda7-0faf4516e5f4","resolution":{"observed_at":"2026-08-07T23:21:24.732040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.508698Z","title":"Rdt-1b: a diffusion foundation model for bimanual manipulation,","venue":null,"work_id":"72d7f387-d627-4917-9589-35d121f22ad1","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.737749Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:c747a9441b779be3239c3704a9842fc52c658b895e14144b05cbad8756fd747c","observation_id":"e4303813-9f78-4651-87a1-57c8dd7caa7e","resolution":{"observed_at":"2026-08-07T23:21:25.513861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:24.742557Z","title":"Efficient prompting for llm-based generative internet of things,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.742557Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:0a49dcac218d91a5e0fa1c1ea32339cd1d9bd666d66788bf95b84a80805092a3","observation_id":"db939c55-5a15-45c2-bea6-2a2e39185b03","resolution":{"observed_at":"2026-08-07T23:21:24.742557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.11514","last_updated":"2022-12-06T11:09:39Z","snapshot_observed_at":"2026-07-06T13:34:29.673291Z","submitted_at":"2022-07-23T13:10:25Z","title":"Semantic Abstraction: Open-World 3D Scene Understanding from 2D Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.11514","snapshot_observed_at":"2026-08-07T23:21:24.747622Z","title":"Ha and S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.747622Z"},"links":{"cited_paper":"/paper/2207.11514","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:1b49d96e8972c99c23937ce57837aa9e7822fd65e2463d0be881299d9ece5e0d","observation_id":"63d58fa0-3574-4969-ac1b-568fd8927efc","resolution":{"observed_at":"2026-08-07T23:21:24.747622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10568","last_updated":"2025-11-14T09:52:46Z","snapshot_observed_at":"2026-08-05T12:56:51.825212Z","submitted_at":"2024-03-14T17:47:10Z","title":"MoPE: Mixture of Prompt Experts for Parameter-Efficient and Scalable Multimodal Fusion","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10568","snapshot_observed_at":"2026-08-07T23:21:24.753064Z","title":"Mope: Parameter-efficient and scalable multimodal fusion via mixture of prompt experts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.753064Z"},"links":{"cited_paper":"/paper/2403.10568","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:586a8ff0e704c6c6b4156d6776f1bcae70c06dccc059f726d5b7610c57150d12","observation_id":"b3dd1daa-2245-406c-9a63-245a6f9dc0e8","resolution":{"observed_at":"2026-08-07T23:21:24.753064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-07T23:21:24.758518Z","title":"Rt-1: Robotics transformer for real-world control at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.758518Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:c6a8cebddd29898889484ddf35cba11c98df78dff22be057a5865b06ce01d3e0","observation_id":"2b21e68d-9dcf-41fb-9b49-debcb5b69290","resolution":{"observed_at":"2026-08-07T23:21:24.758518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.482449Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":"10e35576-250d-4dec-af2d-3818240e409c","year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.763904Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:bd8a7722341fdd627099c0cf3ffeaf2b0b31623abab111b2704d35b8693d79a1","observation_id":"2edb81ef-8720-445f-ac1b-a00f0160b2a8","resolution":{"observed_at":"2026-08-07T23:21:25.487551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01378","last_updated":"2024-02-05T03:46:00Z","snapshot_observed_at":"2026-07-31T21:45:51.138808Z","submitted_at":"2023-11-02T16:34:33Z","title":"Vision-Language Foundation Models as Effective Robot Imitators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01378","snapshot_observed_at":"2026-08-07T23:21:24.768834Z","title":"Vision-language foundation models as effective robot imitators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.768834Z"},"links":{"cited_paper":"/paper/2311.01378","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:95bf076289dc757c2ff8d7f0a93cf18f49aee3da474adf0494dffd6ea1712ec8","observation_id":"5dac971e-7165-498f-bab5-2a201487cda7","resolution":{"observed_at":"2026-08-07T23:21:24.768834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05779","last_updated":"2023-11-09T22:55:10Z","snapshot_observed_at":"2026-08-09T12:29:25.734742Z","submitted_at":"2023-11-09T22:55:10Z","title":"Language-guided Robot Grasping: CLIP-based Referring Grasp Synthesis in Clutter","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05779","snapshot_observed_at":"2026-08-07T23:21:24.774141Z","title":"Language-guided robot grasping: Clip-based referring grasp synthesis in clutter,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.774141Z"},"links":{"cited_paper":"/paper/2311.05779","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:b169a923c9945e81e2c0202548becf32050a0929c18ae5266ffe7f96ab7e9f28","observation_id":"1be82fd3-1d8a-455e-a8f3-e46619735dc8","resolution":{"observed_at":"2026-08-07T23:21:24.774141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.560898Z","title":"Clip-fo3d: Learning free open-world 3d scene representations from 2d dense clip,","venue":null,"work_id":"32d0c7eb-8816-4a57-b1e6-f36d62e50f31","year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.779551Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:5a1d292a45ce278b07ec2e92b5889c5c9db1d741d73d8c13c07047bc4bf8b4d0","observation_id":"5672150c-e946-4f3c-b69c-2e4663618561","resolution":{"observed_at":"2026-08-07T23:21:25.566103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.465129Z","title":"Survey on large language model-enhanced reinforce- ment learning: Concept, taxonomy, and methods,","venue":null,"work_id":"84707db7-b790-4f84-801b-c3130ae86416","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.783804Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:fd4207e2b0db2745291fcf354596af51da968c6bba71fc4d2143bfa102c2c00b","observation_id":"d6f29f30-3c78-4bd7-8c59-bf4e3af90faf","resolution":{"observed_at":"2026-08-07T23:21:25.471120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.447671Z","title":"To boost zero- shot generalization for embodied reasoning with vision-language pre- training,","venue":null,"work_id":"5477590f-4569-4303-a5b4-a016b6a578e5","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.788247Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:0355d2363436064800bc35016cc5300eaf4c26d16412c42e58f110c7a2ecd6f0","observation_id":"d0ee76e6-55ff-4f75-bc82-6464aa67469a","resolution":{"observed_at":"2026-08-07T23:21:25.453133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.431561Z","title":"A survey of visual navigation: From geometry to embodied ai,","venue":null,"work_id":"607e90af-7668-4311-8f89-9d08353423f7","year":2022},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.792831Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:b70d4530aadf71ad206e3937dff93169e2306746cf207a6776860a164ee76198","observation_id":"6bdcfdb4-4f9c-43a8-9975-ecc8eeaabb98","resolution":{"observed_at":"2026-08-07T23:21:25.436777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.416116Z","title":"Delving into multi-modal multi-task foundation models for road scene understanding: From learning paradigm perspectives,","venue":null,"work_id":"b50461c5-dc2d-49fe-9cdf-75734bad8ac3","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.797181Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:5fe90cc0fd169cc9c75cab466221284605607cf737b72eab657f1c74534bbc74","observation_id":"c56990b9-2c38-4115-b99a-27b781f9bc51","resolution":{"observed_at":"2026-08-07T23:21:25.421188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-07T23:21:24.801646Z","title":"Do as i can, not as i say: Grounding language in robotic affordances,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.801646Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:faa501860dd36b31cd1251477ce22e3f467eedd6607b89370a9c8e931d53e826","observation_id":"8e710c2c-f061-4eec-bc6b-dd7432edafe1","resolution":{"observed_at":"2026-08-07T23:21:24.801646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-07T23:21:24.806266Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.806266Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:f0062ff00f2f8db22f91cf1d493bc8a784d0eaef6c28cb70b651720f875d8e99","observation_id":"ce9e92b8-da09-4c38-9e66-14355fae9f8e","resolution":{"observed_at":"2026-08-07T23:21:24.806266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T23:21:24.811203Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.811203Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:5a07884eeda00c4b36f685748b8918a8374ac0ce3d3366c64983ec3dba629d20","observation_id":"5eef3c2e-3460-4598-bd12-47a07501e139","resolution":{"observed_at":"2026-08-07T23:21:24.811203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.400015Z","title":"Interactive planning using large language models for partially observable robotic tasks,","venue":null,"work_id":"ab7d0ebb-2cd1-434e-8742-dd46d61c5cf4","year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.816705Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:3d6393125d7d1b21462edb1fc936cdc191b7c70611bb0ddd0b2e249621326779","observation_id":"31967dc6-4202-4999-9f0f-f97c8f0ba81a","resolution":{"observed_at":"2026-08-07T23:21:25.405220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-07T23:21:24.821792Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual input and output,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.821792Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:8ed5e186195a4146200810818174288478944c23f0e3862f47a1e0591847137c","observation_id":"a9d24f4f-73ac-4492-aabf-9e8db7fb4ba3","resolution":{"observed_at":"2026-08-07T23:21:24.821792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-07T23:21:24.826991Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.826991Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:8ce76ac87c24eedf9a4fdacfcc83b1b3c839c3f7e918950e95fb647834128192","observation_id":"5561590d-e2a0-4435-958a-18c289f144d5","resolution":{"observed_at":"2026-08-07T23:21:24.826991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.384070Z","title":"Visual language maps for robot navigation,","venue":null,"work_id":"e339b777-a652-4283-b8f1-a80d8f95b1d9","year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.832463Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:ebd98fbccc536f8f7c6fc041711a230c3ae63261a223e0d1d2897d540e386777","observation_id":"bf7997dd-d115-4180-8a32-710dd69bab63","resolution":{"observed_at":"2026-08-07T23:21:25.389029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.170837Z","title":"Ving: Learning open-world navigation with visual goals,","venue":null,"work_id":"c296d9c3-1d5c-4770-b746-cd1c19874e67","year":2021},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.837326Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:635b7741f390fd6752e7bb9fee7afc3b8e534e86f84b5434a5c6cb18ab041b82","observation_id":"2aed1b5c-b8c2-48d6-948e-8cd12ab6780b","resolution":{"observed_at":"2026-08-07T23:21:25.177254Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-08T22:04:13.117781Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-07T23:21:24.842290Z","title":"Palm-e: An embodied multimodal language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.842290Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:0a4dcc167c2a8d2dc8dd68dbc163c2cbbf8349b9d26fe4cd7d1847b41a65e573","observation_id":"ce7cb4ab-9fb5-4273-b845-f81d216c5e45","resolution":{"observed_at":"2026-08-07T23:21:24.842290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:24.847764Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.847764Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:c8f06afaef7d3ebfd35a25a3d020b43ec28266f84b16fc30608e56daa013ffb0","observation_id":"53a05805-5044-4462-ab8f-e913e47f8993","resolution":{"observed_at":"2026-08-07T23:21:24.847764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:21:25.357441Z","title":"Patchwork++: Fast and robust ground segmentation solving partial under-segmentation using 3d point cloud,","venue":null,"work_id":"6c934d28-70c4-48e7-b7fb-bb0b4662037f","year":null},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.858979Z"},"links":{"citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:b2a8d56980033b09989706fb8e7826211c1933915d6a1e80e6ea3906fb4e48f1","observation_id":"87ac9c5b-7f41-4d79-9682-7f5f6d967e21","resolution":{"observed_at":"2026-08-07T23:21:25.362772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12952","last_updated":"2024-01-17T22:41:29Z","snapshot_observed_at":"2026-08-02T23:50:48.668259Z","submitted_at":"2023-08-24T17:41:20Z","title":"BridgeData V2: A Dataset for Robot Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12952","snapshot_observed_at":"2026-08-07T23:21:24.869616Z","title":"Bridgedata v2: A dataset for robot learning at scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.869616Z"},"links":{"cited_paper":"/paper/2308.12952","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:237ebf818df833843fdfac2e221bbeab8b99a940e0106716cd789240dfebad4f","observation_id":"ef31a0f3-933b-443c-8e1d-c271e5f3973a","resolution":{"observed_at":"2026-08-07T23:21:24.869616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T23:21:24.853042Z","title":"Available: https://arxiv.org/abs/2106.09685","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.853042Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:2ecfbc8cc07c26ba23fb09224fb37bc466f80599c5983aa47216bae27c7f3480","observation_id":"5f592ef7-a54d-4ce8-9b5a-dab006be4acf","resolution":{"observed_at":"2026-08-07T23:21:24.853042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.11919","last_updated":"2022-09-27T04:26:13Z","snapshot_observed_at":"2026-08-04T07:16:09.346579Z","submitted_at":"2022-07-25T06:09:02Z","title":"Patchwork++: Fast and Robust Ground Segmentation Solving Partial Under-Segmentation Using 3D Point Cloud","version":2},"cited_work":{"arxiv_id":"2207.11919","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.11919","snapshot_observed_at":"2026-08-07T23:21:24.924937Z","title":"Patchwork++: Fast and Robust Ground Segmentation Solving Partial Under-Segmentation Using 3D Point Cloud","venue":"cs.RO","work_id":"b7ddc203-5f46-4acd-8f40-932c05a7f6b8","year":2022},"citing_paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T23:21:24.864173Z"},"links":{"cited_paper":"/paper/2207.11919","citing_paper":"/paper/2502.08903"},"observation_digest":"sha256:8b41bdd1d3add6f2bb0d3c93871a4a12fa947a664dd5ad695b408c5f79b5e1a3","observation_id":"bc592cf2-c519-4d80-89cd-abfd98a46259","resolution":{"observed_at":"2026-08-07T23:21:24.932684Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.08903","last_updated":"2025-02-13T02:40:19Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T16:35:31.305917Z","submitted_at":"2025-02-13T02:40:19Z","title":"3D-Grounded Vision-Language Framework for Robotic Task Planning: Automated Prompt Synthesis and Supervised Reasoning"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":21,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2502.08903."}