{"as_of":"2026-08-22T21:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:765334b26d7f573c5f37d25039abf5fa8a061876ecace5ff4759f6d97dcd47b9","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:49:30.820951Z","state":"measured"},{"denominator":92,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":92,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:25:08.079163Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T22:34:02.921560Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12286","snapshot_observed_at":"2026-08-11T21:29:49.762251Z","title":"Glover: Generalizable open-vocabulary affor- dance reasoning for task-oriented grasping.arXiv preprint arXiv:2411.12286, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04383","last_updated":"2025-05-29T14:14:03Z","snapshot_observed_at":"2026-08-20T11:48:46.030114Z","submitted_at":"2024-12-05T17:58:43Z","title":"SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T21:29:49.762251Z"},"links":{"cited_paper":"/paper/2411.12286","citing_paper":"/paper/2412.04383"},"observation_digest":"sha256:cd2cd4650c29795cbe84c5fde84ae59d170d28350cb9e9dda9e00370931b4339","observation_id":"70c56b15-cd52-48d3-88d1-198c23fb25e6","resolution":{"observed_at":"2026-08-11T21:29:49.762251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12286","snapshot_observed_at":"2026-08-16T11:25:08.079163Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15650","last_updated":"2026-07-10T15:14:57Z","snapshot_observed_at":"2026-08-21T09:13:54.497200Z","submitted_at":"2025-04-22T07:16:56Z","title":"AffordanceSAM: Segment Anything Once More in Affordance Grounding","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T11:25:08.079163Z"},"links":{"cited_paper":"/paper/2411.12286","citing_paper":"/paper/2504.15650"},"observation_digest":"sha256:0c055a1dcf69d9f92064b01f0b1fee374cff4c591d15e00014e843c660e44081","observation_id":"5a6e2fec-8347-447b-adb2-b7a5f4cb4307","resolution":{"observed_at":"2026-08-16T11:25:08.079163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12286","snapshot_observed_at":"2026-08-15T22:35:20.131854Z","title":"Glover: Generaliz- able open-vocabulary affordance reasoning for task-oriented grasping,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.06832","last_updated":"2025-05-11T04:05:02Z","snapshot_observed_at":"2026-08-18T18:52:25.718959Z","submitted_at":"2025-05-11T04:05:02Z","title":"UniDiffGrasp: A Unified Framework Integrating VLM Reasoning and VLM-Guided Part Diffusion for Open-Vocabulary Constrained Grasping with Dual Arms","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T22:35:20.131854Z"},"links":{"cited_paper":"/paper/2411.12286","citing_paper":"/paper/2505.06832"},"observation_digest":"sha256:35e2c2a1e3b5ac9ca9270d5c199cf8e6e2e943fdd5f8ef09b96dc70ad8ba8692","observation_id":"71a85292-8b2c-404b-9d79-ff193c71a4c2","resolution":{"observed_at":"2026-08-15T22:35:20.131854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12286","snapshot_observed_at":"2026-08-15T20:50:54.050659Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11865","last_updated":"2025-05-17T06:14:31Z","snapshot_observed_at":"2026-08-19T08:53:46.018202Z","submitted_at":"2025-05-17T06:14:31Z","title":"GLOVER++: Unleashing the Potential of Affordance Learning from Human Behaviors for Robotic Manipulation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:50:54.050659Z"},"links":{"cited_paper":"/paper/2411.12286","citing_paper":"/paper/2505.11865"},"observation_digest":"sha256:a22aaf61e10842fc047473cc25cb7a6c50696a656ba543c83b4ff5180c4be358","observation_id":"76193305-dd26-4084-a95c-56b5e1181566","resolution":{"observed_at":"2026-08-15T20:50:54.050659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12286","snapshot_observed_at":"2026-08-07T14:22:21.348836Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19214","last_updated":"2025-08-28T13:09:08Z","snapshot_observed_at":"2026-08-17T00:13:07.635888Z","submitted_at":"2025-05-25T16:21:19Z","title":"Omni-Perception: Omnidirectional Collision Avoidance for Legged Locomotion in Dynamic Environments","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:21.348836Z"},"links":{"cited_paper":"/paper/2411.12286","citing_paper":"/paper/2505.19214"},"observation_digest":"sha256:52dd08265b23ee9b826f89fde76667af8dde2308c6db3db99775e49c0c7b958a","observation_id":"dbd724ca-04cf-4234-b90c-ef5fad556cc5","resolution":{"observed_at":"2026-08-07T14:22:21.348836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12286","snapshot_observed_at":"2026-08-07T13:12:18.478933Z","title":"Glover: Generalizable open-vocabulary affor- dance reasoning for task-oriented grasping,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22429","last_updated":"2025-05-28T14:53:53Z","snapshot_observed_at":"2026-08-13T18:25:59.814749Z","submitted_at":"2025-05-28T14:53:53Z","title":"Zero-Shot 3D Visual Grounding from Vision-Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T13:12:18.478933Z"},"links":{"cited_paper":"/paper/2411.12286","citing_paper":"/paper/2505.22429"},"observation_digest":"sha256:2c84e70f8a9ef68c49f393baca31bb0201bf101d3b70eeade50997b19e5d174b","observation_id":"b1e0260d-814e-4607-846a-a2b4f28ac11a","resolution":{"observed_at":"2026-08-07T13:12:18.478933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12286","snapshot_observed_at":"2026-08-04T21:18:50.490457Z","title":"Glover: Generaliz- able open-vocabulary affordance reasoning for task-oriented grasping,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08126","last_updated":"2025-09-09T20:07:51Z","snapshot_observed_at":"2026-08-18T18:56:37.528538Z","submitted_at":"2025-09-09T20:07:51Z","title":"Attribute-based Object Grounding and Robot Grasp Detection with Spatial Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T21:18:50.490457Z"},"links":{"cited_paper":"/paper/2411.12286","citing_paper":"/paper/2509.08126"},"observation_digest":"sha256:40c2ee440e87fa20abd082d23ebaa5a2ac59db9fabcdec07677c3fa6ce31664f","observation_id":"73e154f8-05f8-45f2-92f9-a5ddb6d9cfc3","resolution":{"observed_at":"2026-08-04T21:18:50.490457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"cited_work":{"arxiv_id":"2411.12286","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.12286","snapshot_observed_at":"2026-06-29T22:34:02.921560Z","title":"Glover: Generalizable open-vocabulary affor- dance reasoning for task-oriented grasping","venue":null,"work_id":"519f54c2-8b0f-405c-87cd-6c23d0a452d6","year":2024},"citing_paper":{"arxiv_id":"2601.07060","last_updated":"2026-04-04T05:08:38Z","snapshot_observed_at":"2026-08-11T15:47:37.451369Z","submitted_at":"2026-01-11T21:00:58Z","title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-16T15:05:21.907878Z"},"links":{"cited_paper":"/paper/2411.12286","citing_paper":"/paper/2601.07060"},"observation_digest":"sha256:361f989a0616569891a0b7b0c408637e5ebc8b972fe3f2fb45a134a45c8c455e","observation_id":"855fa933-1e89-4120-8ac5-00f10b3fc1e6","resolution":{"observed_at":"2026-05-16T15:08:02.069402Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12286","snapshot_observed_at":"2026-07-15T13:07:10.012493Z","title":"Glover: Generaliz- able open-vocabulary affordance reasoning for task-oriented grasping,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.07690","last_updated":"2026-06-20T08:02:32Z","snapshot_observed_at":"2026-08-11T13:05:54.065121Z","submitted_at":"2026-03-08T15:46:03Z","title":"FrameVGGT: Coherence-Preserving Memory for Bounded Streaming Geometry","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-15T13:07:10.012493Z"},"links":{"cited_paper":"/paper/2411.12286","citing_paper":"/paper/2603.07690"},"observation_digest":"sha256:dd65d2efdb5a654a3f8d23b1000e7c48cd8186c11c9ccc6d65e8a715435c28ff","observation_id":"5f85816f-8ac0-4173-a6b8-e31efa43f837","resolution":{"observed_at":"2026-07-15T13:07:10.012493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"cited_work":{"arxiv_id":"2411.12286","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.12286","snapshot_observed_at":"2026-06-29T22:34:02.921560Z","title":"Glover: Generalizable open-vocabulary affor- dance reasoning for task-oriented grasping","venue":null,"work_id":"519f54c2-8b0f-405c-87cd-6c23d0a452d6","year":2024},"citing_paper":{"arxiv_id":"2605.26396","last_updated":"2026-05-29T07:01:08Z","snapshot_observed_at":"2026-08-12T20:35:56.252174Z","submitted_at":"2026-05-25T23:59:02Z","title":"Advancing Creative Physical Intelligence in Large Multimodal Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T21:09:37.228058Z"},"links":{"cited_paper":"/paper/2411.12286","citing_paper":"/paper/2605.26396"},"observation_digest":"sha256:f80fa43808a65833d768a4210a51f7db45246d9e70294abcde7176b96cb214c3","observation_id":"a786f91d-ca0d-4402-a051-5d08b7d9aa4c","resolution":{"observed_at":"2026-06-29T22:34:02.924455Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12286","snapshot_observed_at":"2026-08-08T18:01:16.598001Z","title":"Glover: Generalizable open-vocabulary affordance rea- soning for task-oriented grasping,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-14T15:53:24.800516Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.598001Z"},"links":{"cited_paper":"/paper/2411.12286","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:0f3fd989844948a04c57e3a86a043a4822a1cf1eb0f4a60fa0e698f5341218dd","observation_id":"037045af-ee10-450d-ae62-be357e4848d7","resolution":{"observed_at":"2026-08-08T18:01:16.598001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.12286/citation-record","integrity":"/paper/2411.12286/integrity","json":"/paper/2411.12286/citation-record.json","paper":"/paper/2411.12286"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-08-18T11:44:22.813405Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-12T17:49:30.359896Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.359896Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:0bbf1bbef3838ad5c31b5c54e45a16eb594fe615dcd6d5d023fd358c0b4dcdbf","observation_id":"608e9e1f-7b26-4660-b075-f717f5f658f6","resolution":{"observed_at":"2026-08-12T17:49:30.359896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.365753Z","title":"Vision-and-language navigation: In- terpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.365753Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:a6ffd7b1dc509d6d655384ecf6f476d0003e76f441b9765dd18ac216550d918b","observation_id":"359dc285-ac82-48f5-9361-9703db638bd8","resolution":{"observed_at":"2026-08-12T17:49:30.365753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:32.265553Z","title":"Affordances from human videos as a versatile representation for robotics","venue":null,"work_id":"ebeee0c2-2914-4c54-aa53-e7f83c0520cd","year":2023},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.372048Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:25bcc169e9a4b5ad514b10d2bb0129887c71ccb22600a1081eabcc594dcd3097","observation_id":"5411c0b3-7f05-42a4-8429-f37fe25198b4","resolution":{"observed_at":"2026-08-12T17:49:32.271225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:32.250099Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"c6a45cbc-ed1d-4821-bde0-d1221267c71d","year":2021},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.377807Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:7b795c8328bc66d3468cc3a696db450196e45ac3fa2ca84ac03c5d4c46f0e9a9","observation_id":"50838abc-8f95-4a86-b1f6-cf69a25c651e","resolution":{"observed_at":"2026-08-12T17:49:32.254930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.383075Z","title":"Hico: A benchmark for recognizing human-object interactions in images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.383075Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:dbdfbb689ae2b03864c99705ffa7223f8cc5455e664bab29a9c31d7d9cdd9cc0","observation_id":"8a193ce1-76ba-4a82-9410-fc4a1ed4eb11","resolution":{"observed_at":"2026-08-12T17:49:30.383075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:32.225371Z","title":"Seg- mentation and superquadric modeling of 3d objects","venue":null,"work_id":"03adae3e-81e3-42a9-aaf1-cb717059cbd7","year":2003},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.387883Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:35d123a6259f120df6e98bb4b3680cefd249de130d53a8ce5de8494571bc7552","observation_id":"cc5775dc-2967-471a-ad50-02e565db4355","resolution":{"observed_at":"2026-08-12T17:49:32.230193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:32.208570Z","title":"Learning af- fordance segmentation for real-world robotic manipulation via synthetic images","venue":null,"work_id":"0e078794-6534-4857-961b-7feec1a27039","year":2019},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.393056Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:8eb04ef498a61d88a2a09ea7ce18bb792629c21c6d2437b26215c4a60264712f","observation_id":"6378feda-957d-411f-95f5-928e686c83c5","resolution":{"observed_at":"2026-08-12T17:49:32.214611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.397991Z","title":"Rescaling egocentric vision: Collection, pipeline and chal- lenges for epic-kitchens-100","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.397991Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:e0e02af25f7bbcf474407ec8e7630e7d8020a7fb34c444f8ebc9d95b08c7bb8f","observation_id":"f1ac590a-7c18-4dfd-9093-e94d1fe21735","resolution":{"observed_at":"2026-08-12T17:49:30.397991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13181","last_updated":"2024-02-20T17:48:11Z","snapshot_observed_at":"2026-08-19T08:07:55.000325Z","submitted_at":"2024-02-20T17:48:11Z","title":"DINOBot: Robot Manipulation via Retrieval and Alignment with Vision Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13181","snapshot_observed_at":"2026-08-12T17:49:30.404117Z","title":"Dinobot: Robot ma- nipulation via retrieval and alignment with vision foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.404117Z"},"links":{"cited_paper":"/paper/2402.13181","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:8ad513ae41184319bb225dfd8ddf81a3f0a5e7e82c2b90b0223b1262237f16d3","observation_id":"d04a0b1b-6be4-4dc1-8a70-664d6415b3cd","resolution":{"observed_at":"2026-08-12T17:49:30.404117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T17:49:30.410031Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.410031Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:fc15dfd7362b8a07649c0e3581743545ffa1014a43b2063afa88984f7eeb987e","observation_id":"0ab1976e-4efb-4f15-9eae-baca59af7ddc","resolution":{"observed_at":"2026-08-12T17:49:30.410031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:32.182509Z","title":"Graspnet-1billion: A large-scale benchmark for general ob- ject grasping","venue":null,"work_id":"a0b14a29-39df-4906-a2c2-b1f01ecd4b62","year":2020},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.416633Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:bf5bc20d702cd8e1b2ae172b9f8221dd97b9aec7481b3e5885dfa3290900da34","observation_id":"a9835eca-9e45-4eeb-a0a2-02ffd2cb71d7","resolution":{"observed_at":"2026-08-12T17:49:32.188110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.421356Z","title":"Anygrasp: Robust and efficient grasp perception in spa- tial and temporal domains","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.421356Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:c18a76b0feb0e7517ab904df4f1cb67299a3fc33d97515738d31894cc2f0d9b4","observation_id":"a770bb3b-f0e1-4576-b878-86ab83ca0f09","resolution":{"observed_at":"2026-08-12T17:49:30.421356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-08-12T19:12:43.246639Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-12T17:49:30.426124Z","title":"Seed-x: Mul- timodal models with unified multi-granularity comprehen- sion and generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.426124Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:ce85209ffee9a35429e6f12bf4cf73f298d86aeae350b2ba2a8b592e9a373950","observation_id":"1e6692bd-5d96-4acb-95f6-af3acf1e9cd0","resolution":{"observed_at":"2026-08-12T17:49:30.426124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:32.154402Z","title":"Gapartnet: Cross-category domain-generalizable object perception and manipulation via generalizable and actionable parts","venue":null,"work_id":"f394aa59-57cc-4a23-b943-f430c4b83239","year":2023},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.432466Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:276b3771c412a3450bc39b9c884bd75be5782e6c5234d9450560745a61fbc97f","observation_id":"97211387-a2e7-45db-9a25-013ccf4e21a4","resolution":{"observed_at":"2026-08-12T17:49:32.159787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.437256Z","title":"Rlafford: End-to-end affor- dance learning for robotic manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.437256Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:503699f19c1dddb00efa159a155585c84118aa80c3fb2557206d95161ab512a9","observation_id":"6d8da085-8c4a-455d-b37e-fd7de460e26e","resolution":{"observed_at":"2026-08-12T17:49:30.437256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:32.123704Z","title":"Rvt: Robotic view transformer for 3d object manipulation","venue":null,"work_id":"080b3885-62e7-4617-a83c-8e4f9a563c81","year":null},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.442534Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:80d09d72afcb232c5c9615f9212e6fe1145dbe76ca43d16553886ce83463f773","observation_id":"44f8e610-94cc-4176-b7e1-56ebc5655576","resolution":{"observed_at":"2026-08-12T17:49:32.129111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:32.106136Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":"c5c19263-9c97-4e64-8b3f-a95c7aa68f45","year":2022},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.447866Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:8d898ac96c491ba2379b0597b6f0b14811a4d18f776eef2f8ec17c94ba26b15f","observation_id":"fe1b7a97-a99c-40c5-afb3-22a0b18317c1","resolution":{"observed_at":"2026-08-12T17:49:32.111600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:32.088282Z","title":"One-shot transfer of affordance regions? affcorrs! In Con- ference on Robot Learning, pages 550–560","venue":null,"work_id":"0ec2184c-91c0-44e1-8671-c17652eee550","year":2023},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.455348Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:e81a0b827efbefc3cf97d9e5bcaff89d6b1be900f22e9de2353797246fd45191","observation_id":"929ee96c-9967-44cd-8146-d85fda2992e6","resolution":{"observed_at":"2026-08-12T17:49:32.094692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:32.070210Z","title":"Attribute based affordance detection from human-object interaction images","venue":null,"work_id":"7c88ce8f-93c0-458d-bf75-51bd0c49f3cb","year":2015},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.461198Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:75142f334b45be4c9009e207f8c06c84e3252f2e105fa1558a4620c353a37ce2","observation_id":"dc3c32c7-595a-4f24-82ea-38de31694720","resolution":{"observed_at":"2026-08-12T17:49:32.075468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.472717Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.472717Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:02b6a48dd7b4fd394fda9577f13f327519d005b276e2c5234adc8069b9316e38","observation_id":"314a422a-9dea-47fc-92ed-e1185c2259f2","resolution":{"observed_at":"2026-08-12T17:49:30.472717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:32.026127Z","title":"Affordance transfer learning for human-object interaction detection","venue":null,"work_id":"508bf08b-6bcf-4668-9cf7-41dd52295f3c","year":2021},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.479526Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:ddc65ab6a1d3bc433972a5b5884bfe54edeef33333cbf7e2943770ccbd7039eb","observation_id":"cb12ebf9-6ae7-4009-82e0-82e69819ebd7","resolution":{"observed_at":"2026-08-12T17:49:32.031715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07549","last_updated":"2024-06-13T08:16:05Z","snapshot_observed_at":"2026-08-18T18:51:12.408199Z","submitted_at":"2024-06-11T17:59:55Z","title":"A3VLM: Actionable Articulation-Aware Vision Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07549","snapshot_observed_at":"2026-08-12T17:49:30.484883Z","title":"A3vlm: Actionable articulation-aware vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.484883Z"},"links":{"cited_paper":"/paper/2406.07549","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:59a7961cb9db8c42ea690e79dd7c0818cf9b21c582806217dba114b476970f53","observation_id":"8de5aa88-2749-46cc-8dfb-a8210b8511a7","resolution":{"observed_at":"2026-08-12T17:49:30.484883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05973","last_updated":"2023-11-02T06:53:37Z","snapshot_observed_at":"2026-08-05T01:03:23.456778Z","submitted_at":"2023-07-12T07:40:48Z","title":"VoxPoser: Composable 3D Value Maps for Robotic Manipulation with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.05973","snapshot_observed_at":"2026-08-12T17:49:30.490603Z","title":"V oxposer: Composable 3d value maps for robotic manipulation with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.490603Z"},"links":{"cited_paper":"/paper/2307.05973","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:14bfcf0da9294844f89dc294e67e0bb205ea7fa1b40820cbe48dc2c5e386282a","observation_id":"b1c67c0c-910b-4a5e-b298-3bf396bf071c","resolution":{"observed_at":"2026-08-12T17:49:30.490603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:32.008775Z","title":"Rlbench: The robot learning benchmark & learning environment","venue":null,"work_id":"0f4cccbe-f2a8-4d29-a3ef-c9c10e9197bf","year":2020},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.495866Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:e6ed350e97a9d05a9b13a07a3b0f67623d16d97745e0f02443a508c6dffbc7fe","observation_id":"75ec6b38-9010-4906-82d7-9e0f2f4aa098","resolution":{"observed_at":"2026-08-12T17:49:32.015367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07487","last_updated":"2024-01-15T06:02:30Z","snapshot_observed_at":"2026-08-20T07:05:11.212758Z","submitted_at":"2024-01-15T06:02:30Z","title":"Robo-ABC: Affordance Generalization Beyond Categories via Semantic Correspondence for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.07487","snapshot_observed_at":"2026-08-12T17:49:30.500635Z","title":"Robo-abc: Affordance gener- alization beyond categories via semantic correspondence for robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.500635Z"},"links":{"cited_paper":"/paper/2401.07487","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:b2ca6599027af0dc9eb4d8b6f9f331999a060b97230805bc2a0e43fb8a9c0886","observation_id":"5f519416-9143-4cee-858b-a5a81e77941e","resolution":{"observed_at":"2026-08-12T17:49:30.500635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.507032Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.507032Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:6453baed7d18041fd68b1dcfb810fd8a980eb1e6be113ebc0799a5e1a6047335","observation_id":"5671fcfa-8913-43bc-88d1-519cbbf4dd60","resolution":{"observed_at":"2026-08-12T17:49:30.507032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.512722Z","title":"Lerf: Language embedded radiance fields","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.512722Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:9780cc20d9b7a4288823d6e73cf843086de1930de1470a74451f3ff5afcb461c","observation_id":"5e552373-75d0-4f00-842b-76ad47847710","resolution":{"observed_at":"2026-08-12T17:49:30.512722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.963626Z","title":"Segment any- thing","venue":null,"work_id":"de027646-4686-44e2-a963-24cc1c10618c","year":2023},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.518724Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:a4ee5ebdeac7e3c222cb297f2c363d7bee91a54bd82bc3b03b4f164ab692fc1b","observation_id":"8fc02802-5903-4a63-adba-f61319085918","resolution":{"observed_at":"2026-08-12T17:49:31.976594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.946021Z","title":"Learning task-oriented grasping from human activity datasets","venue":null,"work_id":"862d0b3a-d4a9-4fd8-936e-eaadb588a3e1","year":2020},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.523400Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:c53c1d972c93d8ba2ad97309de4cf28a3ab65c5292a5d541b3312896bb2b7ffb","observation_id":"7a265f5c-5ffe-46b5-9c97-39d0a7010675","resolution":{"observed_at":"2026-08-12T17:49:31.952149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.528557Z","title":"Beyond the nav-graph: Vision-and-language navigation in continuous environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.528557Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:4128a4ad4fe760ce4ceddea3a73c5aba8dc720572fe2d7542587d549293227e1","observation_id":"554a1ae9-68bd-43a8-82b0-1b50ba179485","resolution":{"observed_at":"2026-08-12T17:49:30.528557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.918294Z","title":"Waypoint models for instruction- guided navigation in continuous environments","venue":null,"work_id":"3963ba51-4ec2-4926-bcf8-8ae0ba9130f8","year":2021},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.533414Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:c2e6de5f90cb3a6ce7e38c9e31d0cbf4d0ebbc4c4c59bf6772248b155ab30a53","observation_id":"53200fe7-c0ec-4719-ada4-155d58f000b0","resolution":{"observed_at":"2026-08-12T17:49:31.923842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04689","last_updated":"2024-07-05T17:50:38Z","snapshot_observed_at":"2026-08-16T13:36:42.466358Z","submitted_at":"2024-07-05T17:50:38Z","title":"RAM: Retrieval-Based Affordance Transfer for Generalizable Zero-Shot Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04689","snapshot_observed_at":"2026-08-12T17:49:30.538840Z","title":"Ram: Retrieval-based affordance transfer for gen- eralizable zero-shot robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.538840Z"},"links":{"cited_paper":"/paper/2407.04689","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:7e4a0d59570020d9bff7104b380f4c6fe453f42f716f738545763a6e5d5402ca","observation_id":"37a5afad-c428-44cf-b362-a544ab4b0963","resolution":{"observed_at":"2026-08-12T17:49:30.538840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.899670Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"8aa0b73b-905a-4fb0-a767-715be0a9d9c0","year":2024},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.543870Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:197c456a0430db9cece16c567f7873b50355a7b652fe93c3e7e746e4e57ceeb1","observation_id":"702a615e-86fb-4fd1-bae2-59b2181ad232","resolution":{"observed_at":"2026-08-12T17:49:31.905098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.884847Z","title":"Su- perquadrics for segmenting and modeling range data","venue":null,"work_id":"cb7c8da1-ca9c-4b56-994e-86a34dc7c500","year":1997},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.549988Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:34992eeed0f70272c23e6bd472147c60ef73fcb862174c49f8aea877ab38f388","observation_id":"8c31424a-81cf-406f-adf2-a4ecbbd29121","resolution":{"observed_at":"2026-08-12T17:49:31.889468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.868286Z","title":"Locate: Localize and transfer object parts for weakly supervised affordance grounding","venue":null,"work_id":"83ad93bc-868f-423d-a1eb-9deae738dd51","year":2023},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.555536Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:505a6dca5676708f7296dadad55ada358ab27468b25f77a4e932a6974b4b628b","observation_id":"ec95d471-46e0-49ea-b444-9a11d3c66458","resolution":{"observed_at":"2026-08-12T17:49:31.873976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.560590Z","title":"Learning precise affordances from egocentric videos for robotic manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.560590Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:2664720c39b67be8111b35bf0a664d3c07e601d73bc235651268ab6147487c9a","observation_id":"c25f18df-53fb-418d-af32-164bc5c8e5a0","resolution":{"observed_at":"2026-08-12T17:49:30.560590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18062","last_updated":"2024-03-26T19:26:53Z","snapshot_observed_at":"2026-08-16T14:06:07.108949Z","submitted_at":"2024-03-26T19:26:53Z","title":"ShapeGrasp: Zero-Shot Task-Oriented Grasping with Large Language Models through Geometric Decomposition","version":1},"cited_work":{"arxiv_id":"2403.18062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.18062","snapshot_observed_at":"2026-08-12T17:49:31.143096Z","title":"ShapeGrasp: Zero-Shot Task-Oriented Grasping with Large Language Models through Geometric Decomposition","venue":"cs.RO","work_id":"8e648c36-50dc-4226-b832-9ea4f84f2eae","year":2024},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.566320Z"},"links":{"cited_paper":"/paper/2403.18062","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:20095af83fca25612bf136de134212ced11c62d59dfe9efec2b85f9bc1d789b9","observation_id":"86937ca8-1449-4adc-97c3-aedff26e1cde","resolution":{"observed_at":"2026-08-12T17:49:31.158871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.571747Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.571747Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:eb4024451051fefc08a92807c949464c354e048c65f80f5c1cac5f6cd18ae48a","observation_id":"f6f5087a-fb10-47e8-b9ab-c69292f55753","resolution":{"observed_at":"2026-08-12T17:49:30.571747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1708.02002","last_updated":"2018-02-07T18:44:44Z","snapshot_observed_at":"2026-08-17T00:09:26.216715Z","submitted_at":"2017-08-07T06:32:42Z","title":"Focal Loss for Dense Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.02002","snapshot_observed_at":"2026-08-12T17:49:30.578055Z","title":"Focal loss for dense object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.578055Z"},"links":{"cited_paper":"/paper/1708.02002","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:4f9ed537f6ae575bb43bcb8e8234cb935f35f7531f81bae3c33b59a3b83ee84d","observation_id":"440b680d-0a51-4b7b-b9b6-954085cc0209","resolution":{"observed_at":"2026-08-12T17:49:30.578055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.584311Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.584311Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:4869d0018729507db75fb6ecedf2cb39a9c84c520fd8d255b8d95d22e858b4af","observation_id":"c2e7a99b-3915-4931-acf5-c417dc78fe34","resolution":{"observed_at":"2026-08-12T17:49:30.584311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.830283Z","title":"Artic- ulated object manipulation with coarse-to-fine affordance for mitigating the effect of point cloud noise","venue":null,"work_id":"d80ab1ac-5482-416e-b03a-baf6c9cf83d8","year":2024},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.588897Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:6aa8d1af714012441df15ccce871701d1c833211813a56ce6bfe25d6df14aa20","observation_id":"12114398-735b-4e59-ab51-0acb6f9657e4","resolution":{"observed_at":"2026-08-12T17:49:31.835329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-12T17:49:30.593920Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.593920Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:184879587c411a5ff41be9bc6dd6c2ca444a9d27835e4248cf96dfe0ac59b8ba","observation_id":"8955b8f0-8209-426d-9de8-e1b694586c54","resolution":{"observed_at":"2026-08-12T17:49:30.593920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12202","last_updated":"2024-02-29T17:20:08Z","snapshot_observed_at":"2026-08-18T16:28:31.949068Z","submitted_at":"2024-01-22T18:42:20Z","title":"OK-Robot: What Really Matters in Integrating Open-Knowledge Models for Robotics","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12202","snapshot_observed_at":"2026-08-12T17:49:30.599341Z","title":"Ok-robot: What really matters in integrating open-knowledge models for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.599341Z"},"links":{"cited_paper":"/paper/2401.12202","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:6acc4533b3c8d9c95cbf8f4edf1c47e4f5ffb610c2a86d8d66abf41d2d047870","observation_id":"9a93066f-6835-4164-aa4b-c4afc747436d","resolution":{"observed_at":"2026-08-12T17:49:30.599341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-08-19T16:02:58.628969Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-12T17:49:30.604387Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.604387Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:bc75385069f92a1ae9730abb31af5c0dbbb17e2310bcdc0336e12f75402eb702","observation_id":"aaeb370d-247b-428e-9126-738257a8d714","resolution":{"observed_at":"2026-08-12T17:49:30.604387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.814005Z","title":"Robust and accurate superquadric recovery: A probabilistic approach","venue":null,"work_id":"42cb6532-4b94-469c-9323-48e897fc55e3","year":2022},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.611441Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:e0b1020a25051bc419fa950779620ed601fac3905a8abe6acb875b429fdc92bd","observation_id":"03be31bf-6e6d-44b9-bc8b-ba3d6b38f2e2","resolution":{"observed_at":"2026-08-12T17:49:31.819524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T17:49:30.617199Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.617199Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:d3888124af68cdef90faf64d1ff929d22acaac94a0e095e4a9e63c1a42f8758c","observation_id":"850c248c-55f5-4882-9fb8-728c3dcc6857","resolution":{"observed_at":"2026-08-12T17:49:30.617199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08321","last_updated":"2024-07-18T04:45:47Z","snapshot_observed_at":"2026-08-19T15:08:50.224613Z","submitted_at":"2024-03-13T08:06:41Z","title":"ManiGaussian: Dynamic Gaussian Splatting for Multi-task Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08321","snapshot_observed_at":"2026-08-12T17:49:30.623859Z","title":"Manigaussian: Dynamic gaus- sian splatting for multi-task robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.623859Z"},"links":{"cited_paper":"/paper/2403.08321","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:48ea64c41259ce1fa19ed123bfbd4b750a58801fee402de0cd60c462b52511a0","observation_id":"24ef9a57-509b-4ca4-94a5-abc31936175e","resolution":{"observed_at":"2026-08-12T17:49:30.623859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.797172Z","title":"Vl-grasp: a 6-dof interactive grasp pol- icy for language-oriented objects in cluttered indoor scenes","venue":null,"work_id":"95c9e263-8e43-4afe-9ff7-fb25d4e6d993","year":2023},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.630061Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:9338de263a18348e9bf04bab9a9ae73e52981e1ab811b4459d80ba751092cd6e","observation_id":"b35f9013-30b4-4cc2-a029-52d973d15095","resolution":{"observed_at":"2026-08-12T17:49:31.803412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.643939Z","title":"Learning affordance grounding from exocen- tric images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.643939Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:9034f211fe5584b4260bbf38b2072777d04a1a469f9327e03ba5ed65ae16d946","observation_id":"aace91df-ba68-4202-abcc-cc15cc577baf","resolution":{"observed_at":"2026-08-12T17:49:30.643939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.769750Z","title":"Grounded affordance from exocentric view","venue":null,"work_id":"576b626d-96cb-420a-a25d-b60fed54126a","year":1945},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.649388Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:8258a4a513128ee6db74d87c9b8083f8fa465b34cdb79fa3c285cc4fc78f4b20","observation_id":"1d2a2289-28a9-4040-9cb7-fd72580a86e8","resolution":{"observed_at":"2026-08-12T17:49:31.775095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09738","last_updated":"2024-06-14T05:53:00Z","snapshot_observed_at":"2026-08-19T05:01:11.909683Z","submitted_at":"2024-06-14T05:53:00Z","title":"Contrastive Imitation Learning for Language-guided Multi-Task Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09738","snapshot_observed_at":"2026-08-12T17:49:30.654577Z","title":"Contrastive imitation learning for language- guided multi-task robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.654577Z"},"links":{"cited_paper":"/paper/2406.09738","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:2e1fa21c4a472a9a5deb165a3e8e10b5d6abf5f1db92b302a2b27ac72d5fdb88","observation_id":"e2c5fe55-8f95-4b3e-8dc4-2004b8510a9d","resolution":{"observed_at":"2026-08-12T17:49:30.654577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.662058Z","title":"Nerf: Representing scenes as neural radiance fields for view syn- thesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.662058Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:ad5504a4a68069b7099c730d645984216e0c322500f590fb600725dc54979a64","observation_id":"98fbc494-a593-4ed0-a89e-1be055158aac","resolution":{"observed_at":"2026-08-12T17:49:30.662058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.669278Z","title":"Simple open-vocabulary object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.669278Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:d6cb9bb89afafa54a0f9633031b896ea580eefd9299b310ef343d3f775a39ab9","observation_id":"3bafa02e-ff4c-4e35-b965-97e4e48a76dd","resolution":{"observed_at":"2026-08-12T17:49:30.669278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.675792Z","title":"Where2act: From pixels to actions for articulated 3d objects","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.675792Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:27a85a3eecb01df443deef31f5c95e7ef1bf1cccd3ca33b424d286fd160ab2b5","observation_id":"881c0080-99a0-4cfb-8f41-81c3c0dbab64","resolution":{"observed_at":"2026-08-12T17:49:30.675792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.680782Z","title":"Affordance detection of tool parts from ge- ometric features","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.680782Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:30349877ff9d41e49a5af099334b0ac326c9d2aced180db2214ba93a16d7afe6","observation_id":"668e7983-5db5-499a-89d3-ec70209ebf87","resolution":{"observed_at":"2026-08-12T17:49:30.680782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.709062Z","title":"Where2explore: Few-shot affordance learning for unseen novel categories of articulated objects","venue":null,"work_id":"710d41d1-41d2-415d-b810-5b870300d590","year":2024},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.686460Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:394fb52322e4e9d4f4475820e67a2358e79766182bdf3ae21e5a0a4fd7cfbbf7","observation_id":"a728db16-44d2-447b-b348-116fc69c16d6","resolution":{"observed_at":"2026-08-12T17:49:31.714855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-13T13:59:48.091257Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-12T17:49:30.691544Z","title":"Open x- embodiment: Robotic learning datasets and rt-x models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.691544Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:4956a47a889dcf5b7a8011891d1e2c363d9c7429e779134a76859b3964052562","observation_id":"a93692ce-aaff-4d3d-ba58-569b088c59bf","resolution":{"observed_at":"2026-08-12T17:49:30.691544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.692974Z","title":"Superquadrics revisited: Learning 3d shape pars- ing beyond cuboids","venue":null,"work_id":"2652cbab-717a-4f28-8229-4fa27b4194c4","year":2019},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.697048Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:8582105898a911d18efea85e76589d18d6f2e275b85352b472249043d40f1bc3","observation_id":"9daf0ecb-5c59-49b3-96c3-4c2432ec77be","resolution":{"observed_at":"2026-08-12T17:49:31.698554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.678043Z","title":"Learning unsupervised hierarchical part decomposition of 3d objects from a single rgb image","venue":null,"work_id":"21a9b435-421c-4823-9b39-a56709a7ae1e","year":2020},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.702168Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:03fc90a8c2361fc4cf066d74fbbd761b73579be33f3b7a6ef6be4db3f03fa23b","observation_id":"eab0c066-54ac-4d60-8107-fd49a9b65af0","resolution":{"observed_at":"2026-08-12T17:49:31.682941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.662847Z","title":"Understanding 3d ob- ject interaction from a single image","venue":null,"work_id":"66d5e8c0-a209-47de-94b3-a6013cce9b5b","year":2023},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.706847Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:be3fbde3d56a5aaf5ea3ec6fcb40117b1e17fd1f7ddcc674e5ca50a66ebba0bd","observation_id":"454ca977-c90d-44cb-95ca-64da9e4e24ab","resolution":{"observed_at":"2026-08-12T17:49:31.667621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.646657Z","title":"Understanding 3d object articulation in in- ternet videos","venue":null,"work_id":"18e974f7-3a9a-4a71-8c45-8eedc4fa1d00","year":2022},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.711954Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:808f0694225267d2db7a71ea2772c92ffbd28b8e05c3e228b6279a162d8b7ff4","observation_id":"c532de02-b621-4f51-8a69-f149d1318f2e","resolution":{"observed_at":"2026-08-12T17:49:31.651816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.630676Z","title":"Affordancellm: Grounding affordance from vision language models","venue":null,"work_id":"c2f108db-696d-428f-a5e8-d653937fe077","year":2024},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.717155Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:591827c01aaf790b0ca5f8560ad93b814152380fa586c6d22d21ca6d90fbccef","observation_id":"519633c6-093e-4f8f-8b84-db40045901dd","resolution":{"observed_at":"2026-08-12T17:49:31.635709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07563","last_updated":"2024-11-26T10:31:15Z","snapshot_observed_at":"2026-08-18T08:44:58.665789Z","submitted_at":"2024-03-12T11:51:55Z","title":"Learning Generalizable Feature Fields for Mobile Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07563","snapshot_observed_at":"2026-08-12T17:49:30.721874Z","title":"Learning generalizable feature fields for mobile manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.721874Z"},"links":{"cited_paper":"/paper/2403.07563","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:898f5ca92252f382d9534ca7202d75ab4dd7af451cd607559f00f4663171d4be","observation_id":"3cfa99c4-c6a0-4810-919a-b60d7beb91c0","resolution":{"observed_at":"2026-08-12T17:49:30.721874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.727956Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.727956Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:441799cb7ce03bb7ca6ac3eeb0182c774eaff015c299aedeb01c5958a6306846","observation_id":"af2b704a-3d42-4102-96d8-d7d62b36af76","resolution":{"observed_at":"2026-08-12T17:49:30.727956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.735204Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.735204Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:28328b1e2dd64d41c9801a886e3ae0644c9aad6e1324dcaadcc7de5414d07345","observation_id":"d7600d1d-ecdc-4713-beda-74da2f440f98","resolution":{"observed_at":"2026-08-12T17:49:30.735204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.741273Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.741273Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:230fe6c4cf51b46c24feb1f1b8eb84f380c08f6a980be80cc689683d8f27a965","observation_id":"77f342f0-da00-4685-b1a4-65ed351cd718","resolution":{"observed_at":"2026-08-12T17:49:30.741273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.583844Z","title":"Language embedded radiance fields for zero-shot task-oriented grasping","venue":null,"work_id":"784197a0-98aa-4452-8920-26e9ccc8c135","year":2023},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.747319Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:4baebd3c3de8941d781e7de3384bc5d5cab6a778e61191f409cbf0ab84b92ea1","observation_id":"13cf0d43-9a55-495e-8878-6ef84882d791","resolution":{"observed_at":"2026-08-12T17:49:31.589060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.565359Z","title":"Dbscan revisited, revisited: why and how you should (still) use dbscan.ACM Transactions on Database Systems (TODS), 42(3):1–21, 2017","venue":null,"work_id":"b282e358-688c-4c0f-ade4-731f0bee51c7","year":2017},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.753770Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:e1f2d890b36bd0d2ab7ed4aaff5cfdc94d6e409972b31939c28f7be0745d424c","observation_id":"a7f387c0-fedf-41d5-9558-42a9b5b7cda6","resolution":{"observed_at":"2026-08-12T17:49:31.572353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07931","last_updated":"2023-12-30T01:10:41Z","snapshot_observed_at":"2026-08-19T15:12:14.195360Z","submitted_at":"2023-07-27T17:59:14Z","title":"Distilled Feature Fields Enable Few-Shot Language-Guided Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07931","snapshot_observed_at":"2026-08-12T17:49:30.761822Z","title":"Distilled feature fields en- able few-shot language-guided manipulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.761822Z"},"links":{"cited_paper":"/paper/2308.07931","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:e7cb394cd927f9ed9bd1161b7a2520377e2d9f1b120603ec75a71d5acd2f0baf","observation_id":"06b5b3ac-fcea-45a4-9115-fac28fc50c4a","resolution":{"observed_at":"2026-08-12T17:49:30.761822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.768841Z","title":"Perceiver- actor: A multi-task transformer for robotic manipulation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.768841Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:a784d1b0c51e166a1e9cbae89dd873b70dd29f813477f50e83440f7b10628499","observation_id":"30b09bb4-a91c-4759-9ab2-b2b34a0e88ac","resolution":{"observed_at":"2026-08-12T17:49:30.768841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.529382Z","title":"Recovery of parametric models from range images: The case for superquadrics with global deformations","venue":null,"work_id":"c6d439aa-2a9e-4e67-8ee6-a9de2db6d583","year":1990},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.773899Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:3ed27ce58f9a3e28f2bad8cbe8d501393db3aa72388b155e01443c3b97e7b0f6","observation_id":"9103d5d0-b5c1-4593-953d-4525978614dc","resolution":{"observed_at":"2026-08-12T17:49:31.534798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11564","last_updated":"2025-04-30T09:22:25Z","snapshot_observed_at":"2026-08-16T15:59:47.404093Z","submitted_at":"2023-01-27T07:00:54Z","title":"Learning 6-DoF Fine-grained Grasp Detection Based on Part Affordance Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11564","snapshot_observed_at":"2026-08-12T17:49:30.779723Z","title":"Learning 6-dof fine-grained grasp detec- tion based on part affordance grounding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.779723Z"},"links":{"cited_paper":"/paper/2301.11564","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:ff9771edbe74c46af3bdc4581b44f7a4fdeae41d59ea9cc2efec243b63cd7ef4","observation_id":"3ad72405-9258-4d46-a844-63c297f7bb1b","resolution":{"observed_at":"2026-08-12T17:49:30.779723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.513079Z","title":"A grasping approach based on superquadric models","venue":null,"work_id":"6b7c3dd2-87ae-4d36-9e00-5a47ae3437d1","year":2017},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.785393Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:0faacaea489982ca7104fe8cca8ae440fb309c13e8a8eed64ce4adf8322605d1","observation_id":"d0078067-a605-49ea-89e5-28ccf987146b","resolution":{"observed_at":"2026-08-12T17:49:31.518543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.496364Z","title":"Improving superquadric modeling and grasping with prior on object shapes","venue":null,"work_id":"c42f30a3-e0af-46e1-9d05-688af8b6d7d3","year":2018},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.790970Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:9205648d234bad532a56a166643d2d391136973a83674ba4e63e58b41c82a693","observation_id":"c5c17b83-cf3e-4357-bb43-4a3fc05ebacf","resolution":{"observed_at":"2026-08-12T17:49:31.501611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:30.796340Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.796340Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:2c6840c32a7bd40dbc4eb646005e81d3bb7c0a833ffeb918d862028ea8a66fea","observation_id":"a016ff4d-e04f-4935-a9c3-c98058c75f05","resolution":{"observed_at":"2026-08-12T17:49:30.796340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.466178Z","title":"Learning environment-aware affor- dance for 3d articulated object manipulation under occlu- sions","venue":null,"work_id":"7a043df4-65fd-4038-9b3a-feb12c936e3d","year":2024},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.801305Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:670d441eb13dde30406f113aa23d246483ecb453c1937b8d333fa7a011b97d18","observation_id":"30e8f41d-b09b-42f6-9536-6279e187be39","resolution":{"observed_at":"2026-08-12T17:49:31.471528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.446674Z","title":"A joint modeling of vision-language-action for target-oriented grasping in clutter","venue":null,"work_id":"7e11bdca-4e40-468f-aef9-43f727cbdccf","year":2023},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.806080Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:1a7f25f2dec57c6e39b0d19e88a7dd83c240d92f531a5f3fa5bfd06a6d338c24","observation_id":"6e817d55-aadd-4a3e-8332-dfdf08e93e92","resolution":{"observed_at":"2026-08-12T17:49:31.452223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.430326Z","title":"Taskonomy: Disentangling task transfer learning","venue":null,"work_id":"4df809d8-620c-44eb-9ba3-b10b0d47ffb7","year":2018},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.811386Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:953343d60d00c6d50877d049edfc0805ac02b6fbd180c00375666e3dfc0f5933","observation_id":"51889256-799f-4f53-80f8-f7b1e3c59ae0","resolution":{"observed_at":"2026-08-12T17:49:31.435853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09637","last_updated":"2024-03-14T17:59:46Z","snapshot_observed_at":"2026-08-22T00:19:36.551055Z","submitted_at":"2024-03-14T17:59:46Z","title":"GaussianGrasper: 3D Language Gaussian Splatting for Open-vocabulary Robotic Grasping","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09637","snapshot_observed_at":"2026-08-12T17:49:30.816163Z","title":"Gaussiangrasper: 3d lan- guage gaussian splatting for open-vocabulary robotic grasp- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.816163Z"},"links":{"cited_paper":"/paper/2403.09637","citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:51fa3a753b44f079373ab7fd73521326b8eb0a672a80d7bce64a4ebebbba42bb","observation_id":"4ec8a796-d4b3-4dbd-99f3-04636abd32aa","resolution":{"observed_at":"2026-08-12T17:49:30.816163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:31.414739Z","title":null,"venue":null,"work_id":"62aef835-35a7-4f91-ad72-dd55775b036f","year":null},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":960,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.820951Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:f0c4ed6ae7d8d4a16325c30daf667a0dbc06c5bb5012860b4bf88a128c732a26","observation_id":"78399ba9-27ba-4e2f-a7c4-380b58076897","resolution":{"observed_at":"2026-08-12T17:49:31.419522Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:49:32.053148Z","title":"Springer,","venue":null,"work_id":"90ee2700-f611-4eb0-85cd-41413b318d62","year":null},"citing_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-12T17:49:30.466494Z"},"links":{"citing_paper":"/paper/2411.12286"},"observation_digest":"sha256:cebfb26f0a64766cdff2975837c7782b7e7c1ef258faac5bc99ec81eb0c147ec","observation_id":"b8e61966-28a6-4a69-8ba0-6c42ded02bbe","resolution":{"observed_at":"2026-08-12T17:49:32.058000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-14T19:57:20.036786Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":37},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 11 inbound Pith citation observations for arXiv:2411.12286."}