{"as_of":"2026-08-10T15:38:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ccab75bdd90a61947284286ca1bebc27659f1389275fa21069fc10d3f9b4875b","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:59:30.182455Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T06:18:55.243330Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T20:00:10.735031Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"cited_work":{"arxiv_id":"2506.06535","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.06535","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maplegrasp: Mask-guided feature pooling for language-driven efficient robotic grasping","venue":null,"work_id":"abd8f7a1-fc20-4003-a2d5-4d715914c7b8","year":2025},"citing_paper":{"arxiv_id":"2511.16857","last_updated":"2026-04-19T05:15:27Z","snapshot_observed_at":"2026-07-06T22:36:35.545474Z","submitted_at":"2025-11-20T23:54:15Z","title":"BOP-ASK: Object-Interaction Reasoning for Vision-Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T19:58:19.309634Z"},"links":{"cited_paper":"/paper/2506.06535","citing_paper":"/paper/2511.16857"},"observation_digest":"sha256:1aa3774338ae1763381d4c7e91473b83d4dc8ee1ccb36911c2df02b89e24d77b","observation_id":"953c6cb1-efc4-4e48-9d4e-ea5a098e3913","resolution":{"observed_at":"2026-05-17T20:00:10.738442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06535","snapshot_observed_at":"2026-07-31T06:18:55.243330Z","title":"MapleGrasp: mask-guided feature pooling for language-driven efficient robotic grasping","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24744","last_updated":"2026-07-27T17:59:58Z","snapshot_observed_at":"2026-08-06T17:57:37.442251Z","submitted_at":"2026-07-27T17:59:58Z","title":"Data Pyramid for Embodied Manipulation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T06:18:55.243330Z"},"links":{"cited_paper":"/paper/2506.06535","citing_paper":"/paper/2607.24744"},"observation_digest":"sha256:91a5f56edf6c6f2175b8f1a2940a8affa9854126c8afccd73cd27bcaa2142970","observation_id":"405b64ad-7cef-4384-bd3d-931f7f1737c9","resolution":{"observed_at":"2026-07-31T06:18:55.243330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.06535/citation-record","integrity":"/paper/2506.06535/integrity","json":"/paper/2506.06535/citation-record.json","paper":"/paper/2506.06535"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:38.475682Z","title":"End-to-end train- able deep neural network for robotic grasp detection and semantic segmentation from rgb","venue":null,"work_id":"5b4c5002-a963-4023-8829-10cd4654976d","year":2021},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:22.608398Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:44501535d08580f57edec0da8572a402469447689b17932dce8ddab9874c0757","observation_id":"95d3747e-a435-4af7-819f-b34f2fe1c027","resolution":{"observed_at":"2026-08-07T05:59:38.563723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:38.333940Z","title":"Hifi-cs: Towards open vocabulary visual grounding for robotic grasping using vision-language mod- els, 2024","venue":null,"work_id":"3d75b1b7-3314-4950-92de-40705c405026","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:22.722777Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:eb48ba9ae4f7d609143c9c138c72e3a35f5b712b0739a988d221350555058dd8","observation_id":"d5230111-0944-4869-aaa7-51d05ad76cda","resolution":{"observed_at":"2026-08-07T05:59:38.399923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:38.189839Z","title":"RT-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":"1b7fd5b9-183d-4814-9303-d6a23d6706a8","year":null},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:22.879648Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:c93610a85f99a6b01255784698a47942803167ea481398e2dd4fe8dadd996c62","observation_id":"1d6d9234-71cd-4c17-b891-6ab7bd47d82f","resolution":{"observed_at":"2026-08-07T05:59:38.284066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-10T14:16:30.405696Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-07T05:59:23.007621Z","title":"Open X-Embodiment: Robotic learning datasets and RT-X models.https://arxiv.org/abs/ 2310.08864, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:23.007621Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:ef7c07e297228bdc0d739a558f3691f13f110dde6779ed9f7d3d65b89437b9c5","observation_id":"9b9661ce-8956-4d31-a4b7-792933afa43c","resolution":{"observed_at":"2026-08-07T05:59:23.007621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:38.071703Z","title":"Trust the PRoc3s: Solving long-horizon robotics problems with LLMs and constraint satisfaction","venue":null,"work_id":"a3930b45-a948-49a3-aa1b-2c93248f4deb","year":null},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:23.129115Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:a65d1e8078e365fbf3ef65e2fa7b0dc8fbb7190e9a5f08f3eec36baa813ac59f","observation_id":"8804535b-9083-4b43-ae69-5573142dff35","resolution":{"observed_at":"2026-08-07T05:59:38.116592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:37.941341Z","title":"Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, and Aniruddha Kembhavi","venue":null,"work_id":"7d577475-82ce-4631-aaf1-4d12526bdc65","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:23.245485Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:f962d661ac080abef2c4619b5e98dd7b38963e5430658ff01c3b7e841670455e","observation_id":"c9c66032-d282-4326-80ec-a5260fcb86e0","resolution":{"observed_at":"2026-08-07T05:59:38.002526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:37.796107Z","title":"Jacquard: A large scale dataset for robotic grasp detection","venue":null,"work_id":"1d3d43c6-bcf3-4ee1-aa3b-3fbf08bbe741","year":2018},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:23.383235Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:89cca6d60fce4891dd715a6415339ae91c38608b6d4e4a25c5f792f0a6b1158c","observation_id":"72636aec-7308-464e-8e8b-98f7078e2290","resolution":{"observed_at":"2026-08-07T05:59:37.873290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13441","last_updated":"2025-09-12T23:19:44Z","snapshot_observed_at":"2026-08-07T15:42:59.268386Z","submitted_at":"2025-05-19T17:59:06Z","title":"GraspMolmo: Generalizable Task-Oriented Grasping via Large-Scale Synthetic Data Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13441","snapshot_observed_at":"2026-08-07T05:59:23.566111Z","title":"Graspmolmo: Generalizable task-oriented grasping via large-scale synthetic data genera- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:23.566111Z"},"links":{"cited_paper":"/paper/2505.13441","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:21a044b810cf9f6b47bfa56a29747ca1dc79fac3fc963887eafab704c3bc6bee","observation_id":"4449ba98-7be0-468f-8750-45f386955cb7","resolution":{"observed_at":"2026-08-07T05:59:23.566111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:37.636059Z","title":"Acronym: A large-scale grasp dataset based on simulation","venue":null,"work_id":"5c129916-17e9-4d18-a912-6616a2350899","year":2021},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:23.734957Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:c32e0e5d13d1f2768fd95e6a938fc27be036e3c5a18c67d958ad4f630d725561","observation_id":"c4544b63-71b8-4fb6-a098-b045da646004","resolution":{"observed_at":"2026-08-07T05:59:37.729654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:37.526172Z","title":"GraspNet-1Billion: A large-scale benchmark for general object grasping","venue":null,"work_id":"f7c6f906-6627-404f-85e6-876fada5531b","year":2020},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:23.863902Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:68595e32eaf66d0ac99ad2c3855292f829aaf9a7a99e75a518a300ee150875e8","observation_id":"0058bcd9-a88b-4582-98c9-09c158d40814","resolution":{"observed_at":"2026-08-07T05:59:37.592702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:37.332643Z","title":"Physically grounded vision-language models for robotic manipulation","venue":null,"work_id":"53a6f02d-01f4-4b9d-a436-279b2a18fa4b","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:23.974250Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:c0bc650f191331b80b50e613e5892e3a058b5433accce4b3324a327d9e1fc7ef","observation_id":"80e38701-26c3-4df1-8cc3-b79c95fa4ef2","resolution":{"observed_at":"2026-08-07T05:59:37.421739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:37.153707Z","title":"Rvt2: Learning precise manipulation from few demonstrations","venue":null,"work_id":"75442317-ec2c-41f3-afd7-0c01f5a3d5fc","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:24.079791Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:c79d12c49c7b83db71711602f56b5e9df7f63984a04e51c8af80774a080c565a","observation_id":"1deaa556-6bb4-422e-8f02-e061f21cff2c","resolution":{"observed_at":"2026-08-07T05:59:37.245120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:37.005236Z","title":"Language-grounded dy- namic scene graphs for interactive object search with mobile manipulation","venue":null,"work_id":"67c9778c-9210-47e6-8f2b-aab43a114edb","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:24.256736Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:265a12114226a3fdf22c3f1b4be6ed163c03e8b38f644d24267a306ef4f2a6ee","observation_id":"4377422f-956a-490b-9c78-932e5a1f2b3c","resolution":{"observed_at":"2026-08-07T05:59:37.075236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:36.805895Z","title":"Inner monologue: Embodied reason- ing through planning with language models","venue":null,"work_id":"6af9d598-1394-4787-9f2c-b9d75acc0ef0","year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:24.387555Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:93109bab6f8243671e67ee20e412098fa0a9d2959c1d9c987a351b7642e8bfbe","observation_id":"98abafa1-c906-46d5-95e6-45a8c9ce0719","resolution":{"observed_at":"2026-08-07T05:59:36.886801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:36.620329Z","title":"Effi- cient grasping from rgbd images: Learning using a new rect- angle representation","venue":null,"work_id":"ea66d4ab-a258-4c5a-bd0b-b726f52a42fa","year":2011},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:24.502989Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:a54f5a9cf654741222e8838c65fc155dde9961512c89b1b3f7e3579f1215dc6d","observation_id":"e3a2a822-747f-408d-88b2-8dec101af597","resolution":{"observed_at":"2026-08-07T05:59:36.701046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:36.434632Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models","venue":null,"work_id":"49337841-e451-4e41-93b0-2f66bf8835f2","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:24.611566Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:630336350f450d6d1766e5dfe43ee01d96af70906ce41f97ce5fa877b22f12fa","observation_id":"ac6541b7-d66c-424f-9970-9ab555c89a33","resolution":{"observed_at":"2026-08-07T05:59:36.504139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T05:59:24.715654Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:24.715654Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:f5c5cc859b93208b226b5128641314c422f7354e429468b8291052796fa3d6d5","observation_id":"efc502b1-c795-4751-9c80-ca80a1a1160b","resolution":{"observed_at":"2026-08-07T05:59:24.715654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-08-07T05:59:24.756115Z","title":"Fine-tuning vision-language-action models: Optimizing speed and suc- cess","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:24.756115Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:1b89b2e72db675a376a16262bb958458ad0c4d645415768032c616457b2b3172","observation_id":"64924a4c-7d2e-4595-8831-24af304a44b5","resolution":{"observed_at":"2026-08-07T05:59:24.756115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:36.247983Z","title":"Segment anything","venue":null,"work_id":"1d75e077-7cfb-4ff2-8c41-871cd221f6be","year":null},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:24.859095Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:9e68bcf9fc519aba68d6127a86bf3fadae919f79a2ee2b6b08986ac0c95ec35a","observation_id":"8acab195-1467-4563-a6c8-7b772ae19fca","resolution":{"observed_at":"2026-08-07T05:59:36.320177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:36.045024Z","title":"Antipodal robotic grasping using generative residual convolutional neu- ral network","venue":null,"work_id":"f3f15913-f73f-4b30-a148-228c16054d1c","year":2020},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:24.973178Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:1ad09b0ab0462e496cb4d045827895602206269fcc206e388c57479ce7df866b","observation_id":"6a96d6ae-0ffe-4182-b7f6-2a1a65e858ec","resolution":{"observed_at":"2026-08-07T05:59:36.135015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:35.846376Z","title":"Ovgnet: A unified visual-linguistic framework for open-vocabulary robotic grasping","venue":null,"work_id":"4c2cfee9-42d1-44a5-90c4-8bff426f227f","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:25.044852Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:265a9e083f4e428acb2913b0e4073fdadbdcfdd64305503c1ca007b641cc4b5f","observation_id":"8d15859f-698d-4b35-8eca-405fcc3b0c96","resolution":{"observed_at":"2026-08-07T05:59:35.950064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:35.603330Z","title":"Ovgnet: A unified visual-linguistic framework for open-vocabulary robotic grasping","venue":null,"work_id":"4e0ba147-df1d-475c-8b43-a9507cb852e1","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:25.210319Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:83a3595b01e9c187db06c81d485af5432daba1ff75ef79cb22c9000160476825","observation_id":"a8950cf3-5ee1-4482-b786-7007bb0e4524","resolution":{"observed_at":"2026-08-07T05:59:35.713433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:35.381539Z","title":"Vision-language foun- dation models as effective robot imitators","venue":null,"work_id":"e99e4034-f4ff-477d-aab1-3285949bfc3a","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:25.336778Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:8ce0894e9a7512e3c1cc1f84fdb859b386e6675d68eb9b79ec6d11d38b473f6c","observation_id":"31909571-58c9-41a6-b582-3ab879eff332","resolution":{"observed_at":"2026-08-07T05:59:35.488906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:35.159481Z","title":null,"venue":null,"work_id":"b125573c-b8fa-4767-a705-251cdac74b11","year":2025},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:25.480480Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:e4b95b003da422c1cd2115603e872747d556359cfdbb6dbed035066b7ffc1a44","observation_id":"15acdb14-72b2-4a3b-9598-749606a6de8d","resolution":{"observed_at":"2026-08-07T05:59:35.267215Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12202","last_updated":"2024-02-29T17:20:08Z","snapshot_observed_at":"2026-08-04T04:35:05.950904Z","submitted_at":"2024-01-22T18:42:20Z","title":"OK-Robot: What Really Matters in Integrating Open-Knowledge Models for Robotics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12202","snapshot_observed_at":"2026-08-07T05:59:25.594969Z","title":"Ok-robot: What really matters in integrating open-knowledge models for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:25.594969Z"},"links":{"cited_paper":"/paper/2401.12202","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:c0eaa2da12ff6a7b1dcacfdb8c6421b7f156905a00fd1f16530d9586d90093ea","observation_id":"0c3965e4-eaeb-458b-8cd7-3bf30b0f60a7","resolution":{"observed_at":"2026-08-07T05:59:25.594969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:34.904422Z","title":"Grounding dino: Marry- ing dino with grounded pre-training for open-set object de- tection","venue":null,"work_id":"d6e61f48-60f1-42c7-8569-d32754ae440e","year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:25.698166Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:4af819b94ab84e2e1d83f3eea97e53be6946be474f45948feb7b4993f6a0ff39","observation_id":"4e0eb91f-eaf0-42a7-ac46-1c547ca68b6e","resolution":{"observed_at":"2026-08-07T05:59:35.045677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:34.720453Z","title":"Gao, Xi Vin- cent Wang, and Lihui Wang","venue":null,"work_id":"b17b3b79-aba6-4dee-8cc6-457605bc5088","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:25.822106Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:5a8e32615a15631f14384948b7d4f3acb4fabc5250dacf6617312a314b779cc2","observation_id":"04bbb5e5-bf10-45f8-b658-e3ea8faf660c","resolution":{"observed_at":"2026-08-07T05:59:34.791071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:34.566652Z","title":"Deepseek-vl: Towards real-world vision- language understanding, 2024","venue":null,"work_id":"3dbc4b42-47c8-4752-b103-e49ccc0e9a27","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:25.948312Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:541854c65813f17702dc94d8261a6a197ee2be89e10c89b010ca7de5e0ff8d67","observation_id":"916c6a14-fd01-4e8d-bafa-bbb4aa0e0f7f","resolution":{"observed_at":"2026-08-07T05:59:34.642108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:34.372388Z","title":"Hybrid physical metric for 6-dof grasp pose detection","venue":null,"work_id":"10f0c752-905b-4e21-9b92-0cdfa70a014a","year":2022},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:26.088842Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:686935be0d4617f096fe1f7e020a4a7b180bc107bdb76726146644c21e2b3218","observation_id":"2d5e4f87-565e-4bc3-8ba6-19c355082e09","resolution":{"observed_at":"2026-08-07T05:59:34.476271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:34.205889Z","title":"Vl-grasp: a 6-dof interactive grasp pol- icy for language-oriented objects in cluttered indoor scenes","venue":null,"work_id":"f39c1130-e947-4113-808c-2bc404fe578a","year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:26.196122Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:f1678a64cc60c933c7774f22bcfa51fb90c8973050bce3c08b0f2fca5f8ad70e","observation_id":"bde316c3-db5a-4528-8d4e-2d604cd6a3e7","resolution":{"observed_at":"2026-08-07T05:59:34.294109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14403","last_updated":"2024-09-22T11:45:48Z","snapshot_observed_at":"2026-08-09T19:52:45.186184Z","submitted_at":"2024-09-22T11:45:48Z","title":"GraspMamba: A Mamba-based Language-driven Grasp Detection Framework with Hierarchical Feature Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14403","snapshot_observed_at":"2026-08-07T05:59:26.297329Z","title":"Graspmamba: A mamba-based language- driven grasp detection framework with hierarchical feature learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:26.297329Z"},"links":{"cited_paper":"/paper/2409.14403","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:ab95c26ea002c77cb3092d11fafa4149e7f17b447e494a5b248ab6c3e8949885","observation_id":"7f678d07-53ca-4bb0-b1bd-5ad1f2bd9083","resolution":{"observed_at":"2026-08-07T05:59:26.297329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:34.073265Z","title":"Lightweight language-driven grasp detection using conditional consis- tency model","venue":null,"work_id":"a863aaa6-2ff3-4da4-8af9-fd01d9803e84","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:26.411855Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:923133169df404994876c4382eb1de8939517b88167290b6a0476035e91c6a8b","observation_id":"1ff06100-d67a-4dd8-920d-72a05779c937","resolution":{"observed_at":"2026-08-07T05:59:34.143028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:33.908870Z","title":"Language-driven 6-dof grasp detection using negative prompt guidance","venue":null,"work_id":"9308aae1-d0b7-47a0-8f9f-c3e9307e9a62","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:26.526176Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:6347bab11f3a1aac97badf0094fb9157561e27392d29a3d817031e9f81d0c5c5","observation_id":"e4d91950-9375-4366-97b8-dc1d6c167b02","resolution":{"observed_at":"2026-08-07T05:59:33.962764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12521","last_updated":"2024-09-23T06:04:36Z","snapshot_observed_at":"2026-07-06T19:18:00.304916Z","submitted_at":"2024-09-19T07:24:12Z","title":"GraspSAM: When Segment Anything Model Meets Grasp Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12521","snapshot_observed_at":"2026-08-07T05:59:26.631101Z","title":"Graspsam: When segment anything model meets grasp detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:26.631101Z"},"links":{"cited_paper":"/paper/2409.12521","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:40038350ed21147ba4a34b691391574a46044282bb46d64405a2a7b824a61381","observation_id":"4382b3af-21e9-4b5c-9450-43b3bd7c59be","resolution":{"observed_at":"2026-08-07T05:59:26.631101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18158","last_updated":"2025-03-24T00:39:57Z","snapshot_observed_at":"2026-08-04T01:16:23.160733Z","submitted_at":"2024-06-26T08:17:59Z","title":"3D-MVP: 3D Multiview Pretraining for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18158","snapshot_observed_at":"2026-08-07T05:59:26.711288Z","title":"3d-mvp: 3d multi- view pretraining for robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:26.711288Z"},"links":{"cited_paper":"/paper/2406.18158","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:ea6564f1c258877d9aa2f6d459db37b3cca1f9a4576b7780e6f41f96b0fe1b97","observation_id":"84da3673-2a32-4842-8123-6cac36c08c2b","resolution":{"observed_at":"2026-08-07T05:59:26.711288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:26.875867Z","title":"Sayplan: Ground- ing large language models using 3d scene graphs for scalable task planning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:26.875867Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:6a057c0a736940e9b49bb8add0b022e7763f9d48da7cf1de9b1f81c6911721bd","observation_id":"ad675a5d-fbb1-496c-a3a1-c096f658dc72","resolution":{"observed_at":"2026-08-07T05:59:26.875867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:33.761866Z","title":"SAM 2: Segment anything in images and videos","venue":null,"work_id":"cd97a6ee-194c-498a-9f41-dea0a0b1ce4f","year":2025},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:26.961017Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:f23f4ffa6a3353c40541e7eb3640bf1063aedc2f8c7f5f6bd6a59774e0bb6ec0","observation_id":"874fc6f0-5cf7-43b7-a473-b25a0c20b72b","resolution":{"observed_at":"2026-08-07T05:59:33.836594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:27.082005Z","title":"Sadler, Wei-Lun Chao, and Yu Su","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:27.082005Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:fe7e65a3f8b7098de8c99d62a4f869e8374a65d64864f03275c252371f0d1428","observation_id":"ba039e28-f965-4619-a1ee-96657594658f","resolution":{"observed_at":"2026-08-07T05:59:27.082005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:33.568567Z","title":"Grasping in the wild: Learning 6dof closed- loop grasping from low-cost demonstrations","venue":null,"work_id":"2e03c114-bd9c-42fd-9c4c-424883521ffa","year":2020},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:27.203026Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:8a833a7d49d06f0adb7c35b31c39d58c988a9d29a6ac464220131062f4e0e00e","observation_id":"90556185-0a7f-4436-8081-5fa6887a1a1d","resolution":{"observed_at":"2026-08-07T05:59:33.685490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:33.336638Z","title":"Contact-graspnet: Efficient 6-dof grasp gen- eration in cluttered scenes","venue":null,"work_id":"c7c22880-c87c-4bf5-8363-25d07c5e108c","year":2021},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:27.307342Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:c7d3f1265b80ebdaa0218c3d7ac603f2a4c27890a94bba5bfcbd22f9c660c353","observation_id":"aeb9fe25-0073-4a06-bcf6-a018aabd0836","resolution":{"observed_at":"2026-08-07T05:59:33.460345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:33.208922Z","title":"Foundationgrasp: Generalizable task-oriented grasping with foundation models","venue":null,"work_id":"ee6e4677-9a8b-42fd-8be8-609ebee1aff7","year":2025},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:27.457409Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:848fe04ba76ebe16bf54c410f9e08e53b908fbfc9b0d196af580034593b53e5b","observation_id":"1ae8b650-b462-4bc5-ae8c-32693fb1adb5","resolution":{"observed_at":"2026-08-07T05:59:33.269395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:33.041296Z","title":"Mlp-mixer: An all-mlp ar- chitecture for vision","venue":null,"work_id":"a16bd5fc-395e-4446-af8b-de44efe09ad3","year":2021},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:27.584816Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:c4e9292eb9b3f0d207f253a85b9de65aa528aa13b493d21bc80cf53fcf963c1a","observation_id":"01eadda2-9a00-4ffc-834c-36c28cbcae26","resolution":{"observed_at":"2026-08-07T05:59:33.161225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.795901Z","title":"Towards open- world grasping with large vision-language models","venue":null,"work_id":"4b2a3b4d-cb08-41f0-b47a-a9c245d8fa1b","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:27.686069Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:06ddc06c013c92e03f46fede393dae6fc88c6ba79b65675e20f4aa393f0ba36f","observation_id":"ffc1c13a-1cc4-4606-bcef-97a24d047f52","resolution":{"observed_at":"2026-08-07T05:59:32.918336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.657011Z","title":"Language-guided robot grasping: Clip-based referring grasp synthesis in clutter","venue":null,"work_id":"844c59d1-3149-44e0-a47a-195d489ffac6","year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:27.827578Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:67581325def9a7a5604dd737552d2a5ddf75dcf468cc7bb28022a5a9c5edd05e","observation_id":"6be11674-9bb7-44c0-8bee-7a94c658a422","resolution":{"observed_at":"2026-08-07T05:59:32.698032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.540453Z","title":"Language-driven grasp de- tection with mask-guided attention","venue":null,"work_id":"faa950b5-d978-48b4-a312-54f0a3f680a9","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:27.949297Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:3e014da1635388418e2919b6fac1ef00014769f1b16546249ccac6530061656f","observation_id":"43d95ba8-604b-4d8d-80a3-acabd87a550a","resolution":{"observed_at":"2026-08-07T05:59:32.596186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.412107Z","title":null,"venue":null,"work_id":"5276c2c6-12fc-45f7-9c1c-aa08e5cb9f4e","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:28.038044Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:f8f62371824fbcd426e2ebc80a027b8cfac40f7a8e17af7041d5834b605ca1cc","observation_id":"6e81fb7e-166a-43db-88ca-6573b096d7f6","resolution":{"observed_at":"2026-08-07T05:59:32.492609Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.313502Z","title":null,"venue":null,"work_id":"b399afbe-1464-4989-a811-23489ce138ca","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:28.161716Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:ad1b58a1e1b97fd90b0b7b389e0400bf781671407a7f6f0e1e4ffefbd1509063","observation_id":"641a213e-9eda-4e76-a227-60a72c8335e4","resolution":{"observed_at":"2026-08-07T05:59:32.368506Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.240729Z","title":"Gpt-4v(ision) for robotics: Multimodal task planning from human demonstration","venue":null,"work_id":"4e8ffa6f-0f07-4e37-9e18-994d17347d95","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:28.290693Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:a0dd41be03e3e2810d402b262cfbd35f6187b042577dbeb86f89ac46bc1b5d86","observation_id":"1af2a83d-7d1c-480e-95d7-9343529fd530","resolution":{"observed_at":"2026-08-07T05:59:32.271887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.130414Z","title":"Grasp as you say: Language-guided dexterous grasp genera- tion","venue":null,"work_id":"90735fc5-150e-4e7e-9d93-b8e2fe6c46e7","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:28.362358Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:418dba0214dbc341cd760066753944e0aa247b9f16fb91ae2e96ad520d88b6bf","observation_id":"1a56d105-9007-4492-b106-b077948e6287","resolution":{"observed_at":"2026-08-07T05:59:32.171500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.091246Z","title":"Tidybot: Personal- ized robot assistance with large language models","venue":null,"work_id":"c142c54b-e808-4fd3-a3a2-a1f185c4dc81","year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:28.524037Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:d1c5e68cceac7300c02fc367d9fb28264e405fbad9371ac0bf9c3916b92ef16d","observation_id":"294416c8-393b-4a14-829c-747a29c4fe17","resolution":{"observed_at":"2026-08-07T05:59:32.105335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.052866Z","title":"A joint modeling of vision-language-action for target-oriented grasping in clutter","venue":null,"work_id":"2eec07a3-7680-4124-a13b-d7938ff01c79","year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:28.668792Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:86f7ce45b9cb9f24c4a0cd3543e96c7edd314a693a1d105869207f4b54f756f2","observation_id":"3ef0dfe0-0ff4-4228-8fc4-dc9fe8b725c4","resolution":{"observed_at":"2026-08-07T05:59:32.069134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07824","last_updated":"2023-02-15T18:13:10Z","snapshot_observed_at":"2026-07-06T14:52:11.722960Z","submitted_at":"2023-02-15T18:13:10Z","title":"Instance-wise Grasp Synthesis for Robotic Grasping","version":1},"cited_work":{"arxiv_id":"2302.07824","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.07824","snapshot_observed_at":"2026-08-07T05:59:30.394946Z","title":"Instance-wise Grasp Synthesis for Robotic Grasping","venue":"cs.RO","work_id":"15b9da59-8a06-48c9-9d12-4cfed9ba6282","year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:28.814172Z"},"links":{"cited_paper":"/paper/2302.07824","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:bea62fb09cb0f2254db612e132ff8a1d00079e7e53828a1b8b5adf55e2d9b473","observation_id":"6f45701b-fde2-4643-8fcf-3e20fe3915a1","resolution":{"observed_at":"2026-08-07T05:59:30.485178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:32.016729Z","title":"Universal instance perception as object discovery and retrieval","venue":null,"work_id":"ee152d85-8017-40f8-8589-e36b5408d116","year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:28.954588Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:6afc9bd60957d6eb9a4d54f3403c21c09c2d7d01320c825cf26e0bd1d1ba7003","observation_id":"e1fa16b9-38dc-463b-b2b2-f403246a2b57","resolution":{"observed_at":"2026-08-07T05:59:32.030130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:31.986374Z","title":"Ground4act: Leveraging visual-language model for collaborative pushing and grasping in clutter","venue":null,"work_id":"81fdc03c-9872-4a05-ba8c-ab13c8e7ba77","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.021121Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:8651b3c95cd6b51dd99e04b5bf782a62635a6c812da31b4d479705d181c4fa9e","observation_id":"9f23039d-fbc9-44a0-934d-a1738bf971a6","resolution":{"observed_at":"2026-08-07T05:59:31.998882Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19457","last_updated":"2025-02-07T05:10:48Z","snapshot_observed_at":"2026-07-06T19:23:54.455374Z","submitted_at":"2024-09-28T21:11:25Z","title":"A Parameter-Efficient Tuning Framework for Language-guided Object Grounding and Robot Grasping","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19457","snapshot_observed_at":"2026-08-07T05:59:29.189968Z","title":"A parameter-efficient tuning framework for language-guided object grounding and robot grasping","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.189968Z"},"links":{"cited_paper":"/paper/2409.19457","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:34267de0b79925233517279986b34d7ceca1b8e61bc87d32a12c45f5911ac9a6","observation_id":"2470b129-8cad-4f0c-a086-f2b7fc481499","resolution":{"observed_at":"2026-08-07T05:59:29.189968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:31.945758Z","title":"Se-resunet: A novel robotic grasp detection method","venue":null,"work_id":"3c6213b9-1e2c-4b63-aad6-24eb03195379","year":null},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.307333Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:aee05abad46a4aa36ae0694910f1614e2cfd2f9950e13321db2595136f28eb1c","observation_id":"ae0cf24b-1a09-40af-8434-edc2065200ef","resolution":{"observed_at":"2026-08-07T05:59:31.973274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:31.840801Z","title":"GLiNER: Generalist model for named entity recognition using bidirectional transformer","venue":null,"work_id":"154d2d91-d176-4a10-97e2-bb838c0432d1","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.380199Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:5e668c9fc5301e521eb4c3f53373a0d113e2587d2d5085768541141f39bafb3d","observation_id":"7396091c-f77e-448b-adbd-dbc59406fb45","resolution":{"observed_at":"2026-08-07T05:59:31.887794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:31.663924Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"800ef375-1b16-4f02-b6d2-e054b9a115f2","year":2023},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.522314Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:da592e0f2b49ab320291ae5087f60eadaeb2582db15246ce9b491661d8eaec73","observation_id":"0434e761-0c96-4fda-9833-7318bb7ef5d8","resolution":{"observed_at":"2026-08-07T05:59:31.742129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:31.412705Z","title":"Roi-based robotic grasp detection for object overlapping scenes","venue":null,"work_id":"a0b1b997-3174-4572-affe-67c4a2b446b1","year":2019},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.630514Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:6a7bdffc0ad20f9aa4ead5ea5970a515402e9bfeba43e8cf9cd535c65e26c814","observation_id":"98014d88-fc38-407f-8456-6851306eaac8","resolution":{"observed_at":"2026-08-07T05:59:31.517765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20076","last_updated":"2025-03-10T12:34:24Z","snapshot_observed_at":"2026-08-06T23:39:09.398813Z","submitted_at":"2024-06-28T17:38:18Z","title":"EVF-SAM: Early Vision-Language Fusion for Text-Prompted Segment Anything Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20076","snapshot_observed_at":"2026-08-07T05:59:29.719733Z","title":"Evf-sam: Early vision-language fusion for text-prompted segment anything model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.719733Z"},"links":{"cited_paper":"/paper/2406.20076","citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:137a48c2db8e889b385319ed2a024e7b94872541406249777cc257e556c668a9","observation_id":"6c734f9e-ea84-4ac8-a2e5-80d9356fc318","resolution":{"observed_at":"2026-08-07T05:59:29.719733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:31.184219Z","title":"Language-guided cat- egory push–grasp synergy learning in clutter by efficiently perceiving object manipulation space","venue":null,"work_id":"50175d0b-9800-4055-a29c-1eccbc40b05b","year":2025},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.848669Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:84faa0c8c924348e2a0d3317d96eaac397db1d60e8faf74015fc4b3ca2fb7bdf","observation_id":"37f2c474-a2c0-495b-ac14-5ce4b1aac357","resolution":{"observed_at":"2026-08-07T05:59:31.296924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:30.962332Z","title":"Vlmpc: Vision-language model pre- dictive control for robotic manipulation","venue":null,"work_id":"f740c174-6e31-4c3d-8ae2-72af8d0376e1","year":2024},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:29.952184Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:669f47d343d7bac71fd67b20841c1e1bea6a6e6773b82af578bc8a690800dd97","observation_id":"ea22c6f7-ecd9-47cf-af37-89e8b7bf70da","resolution":{"observed_at":"2026-08-07T05:59:31.051808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:59:30.715950Z","title":"Grasping detection network with uncertainty estima- tion for confidence-driven semi-supervised domain adapta- tion","venue":null,"work_id":"2daccd13-e579-4576-a059-c4c4749b677f","year":2020},"citing_paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:59:30.182455Z"},"links":{"citing_paper":"/paper/2506.06535"},"observation_digest":"sha256:da5d6df6b6cccf5bd383c5037373f75dec9fed80dc6f9d916d5bad1021e9bf8f","observation_id":"e4fa7e13-3078-47fa-8767-b217232b7b8e","resolution":{"observed_at":"2026-08-07T05:59:30.848781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.06535","last_updated":"2025-08-25T17:07:02Z","latest_version":3,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T23:37:52.646461Z","submitted_at":"2025-06-06T21:06:00Z","title":"MapleGrasp: Mask-guided Feature Pooling for Language-driven Efficient Robotic Grasping"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":47},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 2 inbound Pith citation observations for arXiv:2506.06535."}