{"as_of":"2026-08-10T10:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bd7d03f2747d8baabf2dfa6bc53b258a0cc8807cfb0b6e295f355f48dd149da5","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T18:01:16.779978Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05215/citation-record","integrity":"/paper/2608.05215/integrity","json":"/paper/2608.05215/citation-record.json","paper":"/paper/2608.05215"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:18.010105Z","title":"Affordance detection of tool parts from geometric features,","venue":null,"work_id":"acbb198e-1a80-4a86-8216-47f57727b208","year":2015},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.536064Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:973698b8afab07bf1506478025cce746f9fda86bf86b18ff68d4d87ac1f31039","observation_id":"4afcadd5-0916-4933-95db-b78d56ec6edd","resolution":{"observed_at":"2026-08-08T18:01:18.013283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:18.000886Z","title":"Learning affordance grounding from exocentric im- ages,","venue":null,"work_id":"f0fde847-4cb4-4a69-ad09-00df64858cfa","year":2022},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.539998Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:e8990fc515851a70b8a108451cb1df45f5faee91eae81f0e7053754c181c3bd6","observation_id":"737c059f-3284-4117-bad3-93d266628e98","resolution":{"observed_at":"2026-08-08T18:01:18.003826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.971777Z","title":"Object-based affordances detection with convo- lutional neural networks and dense conditional random fields,","venue":null,"work_id":"359f2fa0-0bfd-40c7-9d27-f1d471cb0f7a","year":2017},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.543404Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:7a8f08f716b0c76b32f8ce6822d4bad3a9f946e0fd31944293406d834ed56b65","observation_id":"45ecd236-96a7-471d-9a0b-a4736986750f","resolution":{"observed_at":"2026-08-08T18:01:17.981848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.939787Z","title":"Learning to act properly: Predicting and explain- ing affordances from images,","venue":null,"work_id":"f7708e34-9220-4533-a2b9-93a760114cf0","year":2018},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.546800Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:a8f11b0355341484d1e8565f9996262745fe80fa0b88d7e3f32b8f6b80e72f37","observation_id":"42711c5e-a75c-4848-8349-a382a2261f98","resolution":{"observed_at":"2026-08-08T18:01:17.951637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11865","last_updated":"2025-05-17T06:14:31Z","snapshot_observed_at":"2026-08-07T15:44:25.865763Z","submitted_at":"2025-05-17T06:14:31Z","title":"GLOVER++: Unleashing the Potential of Affordance Learning from Human Behaviors for Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11865","snapshot_observed_at":"2026-08-08T18:01:16.549751Z","title":"Glover++: Unleashing the potential of affordance learn- ing from human behaviors for robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.549751Z"},"links":{"cited_paper":"/paper/2505.11865","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:3c5b0df4e502c60c5b293507daac8464dfe8d5aeef1802d713c8064981941276","observation_id":"a1e962bb-a85c-4fce-9409-fcff03c19749","resolution":{"observed_at":"2026-08-08T18:01:16.549751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.854206Z","title":"H2o: Two hands manipulating objects for first person interaction recognition,","venue":null,"work_id":"fb374ff7-effe-48bf-8999-d96b812ad36a","year":2021},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.553433Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:5812d4f2cd2f6c047404036994445b1ca56a3d0dd6cb85f481640aa33005633a","observation_id":"62e92869-c436-4582-b2e1-320c4eea03ca","resolution":{"observed_at":"2026-08-08T18:01:17.895149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.781985Z","title":"Hoi4d: A 4d egocentric dataset for category-level human-object interaction,","venue":null,"work_id":"d409e195-f69e-44b2-b230-82e3658b09e8","year":2022},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.557077Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:6065d2a5b41df39b48ab80b88fbeec180e8d9fe5245514fc5d7e019756d39ad0","observation_id":"6f046d92-7583-46e3-b762-7ef55f82d38e","resolution":{"observed_at":"2026-08-08T18:01:17.811321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.763188Z","title":"Scaling egocentric vision: The epic-kitchens dataset,","venue":null,"work_id":"1ad2033b-a227-44f2-943b-543afdb4ea58","year":2018},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.560200Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:7ccb3185c1ad8cf9dabfa452c17ab04491bc4188be39145799723d9c857b99e2","observation_id":"415a5eaf-460c-4d5f-947b-2c03f368e661","resolution":{"observed_at":"2026-08-08T18:01:17.766221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04144","last_updated":"2025-03-25T04:54:54Z","snapshot_observed_at":"2026-08-09T20:29:20.505084Z","submitted_at":"2025-02-06T15:25:05Z","title":"HD-EPIC: A Highly-Detailed Egocentric Video Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04144","snapshot_observed_at":"2026-08-08T18:01:16.563055Z","title":"Hd-epic: A highly-detailed egocentric video dataset,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.563055Z"},"links":{"cited_paper":"/paper/2502.04144","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:03f7cdcf9022256dc59ae95e0d4e2b827238d4d964201f78ea1d2ce9170fd54f","observation_id":"25a8e8db-9fa3-4db0-8dc0-8cc1165cfd06","resolution":{"observed_at":"2026-08-08T18:01:16.563055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.754508Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video,","venue":null,"work_id":"847195eb-fb01-496d-a384-2226d0d39f95","year":2022},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.566331Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:cbbb7371021f3fb13ef72be5543712035602404c33155019126fc29caea83170","observation_id":"03f5bd15-b973-486e-b67a-30ca984cf170","resolution":{"observed_at":"2026-08-08T18:01:17.757605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18259","last_updated":"2024-09-25T21:55:38Z","snapshot_observed_at":"2026-08-08T17:40:49.067743Z","submitted_at":"2023-11-30T05:21:07Z","title":"Ego-Exo4D: Understanding Skilled Human Activity from First- and Third-Person Perspectives","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18259","snapshot_observed_at":"2026-08-08T18:01:16.569282Z","title":"Ego-exo4d: Understanding skilled human ac- tivity from first- and third-person perspectives,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.569282Z"},"links":{"cited_paper":"/paper/2311.18259","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:6ae9e1b869792452102ad54119adcb23a4f9e2e863ea7d615019ffd2a0749af0","observation_id":"256cdff0-b054-428c-b8fe-391d72767447","resolution":{"observed_at":"2026-08-08T18:01:16.569282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-08T18:01:16.572856Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.572856Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:cdd14ece2c991e9790f346e2b18f4ecdaebc9785183463df1e935717872de982","observation_id":"6fb84ae5-9966-4d9b-9ea9-393e4f6c26d4","resolution":{"observed_at":"2026-08-08T18:01:16.572856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T18:01:16.576178Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.576178Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:1efa66c4e9f9d6e49e731e07654d102d53f22776f83287fdc1744190d10cf3d4","observation_id":"5c31d479-3971-455c-ac56-ae9a4f27d3b1","resolution":{"observed_at":"2026-08-08T18:01:16.576178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.736685Z","title":"Efficient training of artificial neural networks for autonomous navigation,","venue":null,"work_id":"2030f7cf-54f1-4245-9176-b629035b7a01","year":1991},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.579356Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:d170c7be834f871d1b289efe0960e83507e342ca8b7bad8984ef4b9dc9bcf9fd","observation_id":"1d069619-2cca-4b88-8899-aa069c6b5363","resolution":{"observed_at":"2026-08-08T18:01:17.745322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.00030","last_updated":"2023-03-07T02:29:59Z","snapshot_observed_at":"2026-08-02T00:17:16.761436Z","submitted_at":"2022-09-30T18:14:07Z","title":"VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.00030","snapshot_observed_at":"2026-08-08T18:01:16.582286Z","title":"Vip: Towards universal visual reward and representa- tion via value-implicit pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.582286Z"},"links":{"cited_paper":"/paper/2210.00030","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:d7a93240733cc6b2d1501985c2604b219472009bf7d967de4f7a23c36b4b2913","observation_id":"7453ea79-a5e4-4e0c-aace-a6499a1de816","resolution":{"observed_at":"2026-08-08T18:01:16.582286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06173","last_updated":"2022-03-11T18:58:10Z","snapshot_observed_at":"2026-08-06T13:06:27.360959Z","submitted_at":"2022-03-11T18:58:10Z","title":"Masked Visual Pre-training for Motor Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06173","snapshot_observed_at":"2026-08-08T18:01:16.585792Z","title":"Masked visual pre-training for motor control,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.585792Z"},"links":{"cited_paper":"/paper/2203.06173","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:adfa64b58c8b1930549c6754034e995b952f2e721c70d206cc81521d7c3052ff","observation_id":"199bafe5-7125-46a3-9edb-066e3711d317","resolution":{"observed_at":"2026-08-08T18:01:16.585792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12601","last_updated":"2022-11-18T05:57:09Z","snapshot_observed_at":"2026-08-02T11:48:59.131827Z","submitted_at":"2022-03-23T17:55:09Z","title":"R3M: A Universal Visual Representation for Robot Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12601","snapshot_observed_at":"2026-08-08T18:01:16.589222Z","title":"R3m: A universal visual representation for robot manipulation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.589222Z"},"links":{"cited_paper":"/paper/2203.12601","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:73a8731b0aec384379c0654ebc6e613bc3ed9de206d49e80bb7f1a89f3f233fa","observation_id":"f311e024-7c68-41b7-b879-9780b9ff46ba","resolution":{"observed_at":"2026-08-08T18:01:16.589222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:16.592398Z","title":null,"venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.592398Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:d6de98e8c69189aa7cfe970bafc5e11034da877f518007ad2bd6e98f33c384c4","observation_id":"ecdd8d95-bbfd-49fd-a542-c2319d15605f","resolution":{"observed_at":"2026-08-08T18:01:16.592398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.717546Z","title":"Affordances from human videos as a versatile repre- sentation for robotics,","venue":null,"work_id":"2b8c50c1-cf8f-4590-a3ae-7fd9be5384ca","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.595173Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:c9867e35ef87635492e24fc2308b965b1951a146b9f99c1c47847a5b307187cb","observation_id":"7b81d6aa-d3c8-4c2f-b0e0-b2360a35ca36","resolution":{"observed_at":"2026-08-08T18:01:17.722311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12286","last_updated":"2025-05-01T09:13:09Z","snapshot_observed_at":"2026-08-07T21:46:26.659801Z","submitted_at":"2024-11-19T07:12:48Z","title":"GLOVER: Generalizable Open-Vocabulary Affordance Reasoning for Task-Oriented Grasping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12286","snapshot_observed_at":"2026-08-08T18:01:16.598001Z","title":"Glover: Generalizable open-vocabulary affordance rea- soning for task-oriented grasping,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.598001Z"},"links":{"cited_paper":"/paper/2411.12286","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:a0727ee16f6e7d51047ce45dc15450e6d3e62bbd22cc85b10623c884e9c1102e","observation_id":"037045af-ee10-450d-ae62-be357e4848d7","resolution":{"observed_at":"2026-08-08T18:01:16.598001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.709005Z","title":"Dexycb: A benchmark for capturing hand grasping of objects,","venue":null,"work_id":"e09aad85-a3d2-4075-b0e4-a06da5c54853","year":2021},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.600947Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:a39e104744fcec7942136c18b97b7e44a63e7cc2611d78b5ecb19dccc19da057","observation_id":"47592aa3-039a-4610-9769-65ec639969e8","resolution":{"observed_at":"2026-08-08T18:01:17.712184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.694020Z","title":"Videodex: Learning dexterity from internet videos,","venue":null,"work_id":"661239e2-7524-4724-8907-fdc05787056c","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.603882Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:78c2c331f6833bc4bf56c8399bc250c71499c79203ee0c92c97e6f88e0ec7290","observation_id":"a049b818-b85a-429c-a7a2-3a051bbb495e","resolution":{"observed_at":"2026-08-08T18:01:17.697193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18240","last_updated":"2024-02-01T19:42:05Z","snapshot_observed_at":"2026-08-10T09:12:21.281023Z","submitted_at":"2023-03-31T17:56:33Z","title":"Where are we in the search for an Artificial Visual Cortex for Embodied Intelligence?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18240","snapshot_observed_at":"2026-08-08T18:01:16.606561Z","title":"Where are we in the search for an artificial visual cortex for embodied intelligence?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.606561Z"},"links":{"cited_paper":"/paper/2303.18240","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:6329d95d67a54c2eee6f38dc05a152bfd20fbe26af69d40e18cd315fc614f3c3","observation_id":"185a3a09-3a05-491c-9e43-c17168325096","resolution":{"observed_at":"2026-08-08T18:01:16.606561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00958","last_updated":"2023-06-01T17:52:23Z","snapshot_observed_at":"2026-08-06T20:32:01.174179Z","submitted_at":"2023-06-01T17:52:23Z","title":"LIV: Language-Image Representations and Rewards for Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00958","snapshot_observed_at":"2026-08-08T18:01:16.609530Z","title":"Liv: Language-image representations and rewards for robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.609530Z"},"links":{"cited_paper":"/paper/2306.00958","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:2bf0f85bf6e25d8dea5129b1c3a21ec97209419203ad16fe74a661a822f16139","observation_id":"ac586404-0b6b-43e5-8dfe-a93647b520b7","resolution":{"observed_at":"2026-08-08T18:01:16.609530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.685878Z","title":"Hrp: Human affordances for robotic pre- training,","venue":null,"work_id":"324dcc05-2528-401a-adfb-1ab9f6683afe","year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.613059Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:5a82ea83fdabf53be74ac48812fab6253263e57b199677a8ae0978cb50782107","observation_id":"9a3bd658-5224-4d52-b996-4ef86f051fa4","resolution":{"observed_at":"2026-08-08T18:01:17.688991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07135","last_updated":"2025-03-27T21:33:39Z","snapshot_observed_at":"2026-08-07T17:17:23.602919Z","submitted_at":"2025-03-10T10:04:58Z","title":"VidBot: Learning Generalizable 3D Actions from In-the-Wild 2D Human Videos for Zero-Shot Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07135","snapshot_observed_at":"2026-08-08T18:01:16.616474Z","title":"Vidbot: Learning generalizable 3d actions from in- the-wild 2d human videos for zero-shot robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.616474Z"},"links":{"cited_paper":"/paper/2503.07135","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:e2e5c3ea21109c2cb37613998883d13d6b15a8011d4b63a9ffafe4987ba3cc29","observation_id":"1a14e57d-602e-4b17-9612-b82b3bf0bf1c","resolution":{"observed_at":"2026-08-08T18:01:16.616474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.673277Z","title":"Weakly supervised affordance detection,","venue":null,"work_id":"97310ffe-b830-428b-8065-cac72b552053","year":2017},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.620035Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:8e45ade55b6517bdd93c3fea86459ec77beae7f9824e5a44ba12104edb777a32","observation_id":"28494b12-e07b-4b42-9380-104fbf4387bc","resolution":{"observed_at":"2026-08-08T18:01:17.680508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.584061Z","title":"Locate: Localize and transfer object parts for weakly supervised affordance grounding,","venue":null,"work_id":"baaaa8c2-b6e4-4bae-b9e8-5666b6972c3b","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.623532Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:1861f094a3707c07cc097cb1ff7fd2740a0eb35adc16e33fc506d1bf782263d6","observation_id":"82283a00-7753-47a8-9c02-746ed0f2ea23","resolution":{"observed_at":"2026-08-08T18:01:17.632639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.522666Z","title":"Affordancellm: Grounding affordance from vision language models,","venue":null,"work_id":"90c0458f-5c4f-4a0a-8ec0-6d9518559bc2","year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.626443Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:d074028de9895957400382399d3b26ab851c5aeca73c01858ba3e71b8caeabb8","observation_id":"302c82a3-ba4f-432a-812d-0595356cd66e","resolution":{"observed_at":"2026-08-08T18:01:17.530197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09284","last_updated":"2025-08-25T19:45:29Z","snapshot_observed_at":"2026-08-08T15:02:00.662012Z","submitted_at":"2025-06-10T22:47:16Z","title":"UAD: Unsupervised Affordance Distillation for Generalization in Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09284","snapshot_observed_at":"2026-08-08T18:01:16.629217Z","title":"Uad: Unsupervised affordance distillation for gener- alization in robotic manipulation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.629217Z"},"links":{"cited_paper":"/paper/2506.09284","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:4f270c359af26a6a69a3beec5f42a3e1675bd569e57cd4161459f38f866eb433","observation_id":"7d9ddb00-788c-4c53-af49-f5898a6771a5","resolution":{"observed_at":"2026-08-08T18:01:16.629217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.513800Z","title":"Arctic: A dataset for dexterous bimanual hand-object manipulation,","venue":null,"work_id":"26720561-6183-420d-b71a-07b42c0a2d5f","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.632022Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:60ac4c9653e3c6fcc361dc6768a67b1af44f9e8635dc948cbcde48fcde94e921","observation_id":"f2e4e690-726b-4e55-8dee-6bb6b08e5796","resolution":{"observed_at":"2026-08-08T18:01:17.517069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.505598Z","title":"Contactpose: A dataset of grasps with object contact and hand pose,","venue":null,"work_id":"4b0a4605-8280-42e9-a150-382411469d08","year":2020},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.635490Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:308ecd79861616bc4a8a51acdc095a0d460c1d031edeed98e7f5fbb931126420","observation_id":"2d0a5f96-7ad8-4499-bec2-947c838f8307","resolution":{"observed_at":"2026-08-08T18:01:17.508549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.497867Z","title":"Oakink: A large-scale knowledge repository for understanding hand-object interaction,","venue":null,"work_id":"74006b1e-f72e-48a8-95ba-556aac2bb292","year":2022},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.638183Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:afcc52aa526346d42afc8f3e7ec7921aa3f2e55d62af6f810a6977ea7fbe9c5d","observation_id":"77ba9438-3b92-4fc7-bc55-fdad3caf5c21","resolution":{"observed_at":"2026-08-08T18:01:17.500390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08399","last_updated":"2024-03-25T16:50:43Z","snapshot_observed_at":"2026-08-07T17:52:08.685927Z","submitted_at":"2024-01-16T14:41:42Z","title":"TACO: Benchmarking Generalizable Bimanual Tool-ACtion-Object Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08399","snapshot_observed_at":"2026-08-08T18:01:16.641293Z","title":"Taco: Benchmarking generalizable bimanual tool-action- object understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.641293Z"},"links":{"cited_paper":"/paper/2401.08399","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:f3e4a4a495b0bfc1d10f8c683dcf3da3804de34f804739bd000e7e99ebe30bab","observation_id":"ae0e54f0-4f30-4e0f-bb85-d5738497ec7a","resolution":{"observed_at":"2026-08-08T18:01:16.641293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-08T18:01:16.644533Z","title":"Rt-1: Robotics transformer for real-world control at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.644533Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:06311e9b6cf192e92fb069f46f22261222d4f107f3dbd78d0231cee6fb824539","observation_id":"a7fa2ba1-2ad6-4042-a8a6-b099d5b6de3b","resolution":{"observed_at":"2026-08-08T18:01:16.644533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-08T18:01:16.647941Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.647941Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:dd08295e9ee06ede9b2957f509ce30fc110c741de33e1dac7359f6b0cff817df","observation_id":"f0834910-a2e2-44ea-b176-3987593bb2f3","resolution":{"observed_at":"2026-08-08T18:01:16.647941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-08T18:01:16.650865Z","title":"Openvla: An open-source vision-language-action model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.650865Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:286dd2d38259ee3d3488be586803dd0bb0017c142a9f3f82c8fdcecf205b232b","observation_id":"860b4e08-c7b5-4619-9d48-352a770d01a5","resolution":{"observed_at":"2026-08-08T18:01:16.650865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-08T18:01:16.654079Z","title":"Octo: An open-source generalist robot policy,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.654079Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:d4c9452a3ff5824e5c60f882531ca76bfe26f61602a811d5e45ff28352d7eb4b","observation_id":"73ee612d-2cd4-45f6-bc31-a5f081d21bec","resolution":{"observed_at":"2026-08-08T18:01:16.654079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-08T01:53:43.555672Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-08T18:01:16.657265Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.657265Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:73b4151450e713887b5dd565065e159db7cb4db623dfbd0492fde1ad7835f895","observation_id":"740781d5-193d-4326-9eb2-ceca4192ae9f","resolution":{"observed_at":"2026-08-08T18:01:16.657265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.489722Z","title":"Droid: A large-scale in-the-wild robot manipu- lation dataset,","venue":null,"work_id":"5b49d6eb-cb7d-4f8d-a165-b76559f11d3a","year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.660510Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:4c3286d4c6a62051b0308951e8e8de75fd3d353ead6dc6d0fb87edf8c9291ba4","observation_id":"4a6f6391-124f-473e-bc9c-ac5037d9c8fd","resolution":{"observed_at":"2026-08-08T18:01:17.492748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.482397Z","title":"Embodied hands: Modeling and capturing hands and bodies together,","venue":null,"work_id":"dbc0f367-1d51-4b25-860d-b8df6194746b","year":2017},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.663405Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:8200a3fefda98d9b3177a418ee16fbd28c3f590d782dd4756bbfeb2a4b934206","observation_id":"58cc99cf-5216-4b4e-9ed6-eb0907e52b96","resolution":{"observed_at":"2026-08-08T18:01:17.484941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.474463Z","title":"On the continuity of rotation representations in neural networks,","venue":null,"work_id":"6c22b179-9d78-4163-a515-ec0acc6fcca2","year":2019},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.666562Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:c91ce811049285fb4569863ef528759e5a6ab479916930e819f03b8825b6963e","observation_id":"f73652f3-7549-4cf5-b5f7-eb0aab744698","resolution":{"observed_at":"2026-08-08T18:01:17.477628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.465879Z","title":"Understanding human hands in contact at internet scale,","venue":null,"work_id":"2a54e71e-5152-4fb7-af4a-0e94a7eec143","year":2020},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.669770Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:f73576e38682d5d614100a92c37221949f96aa87239c0057c9b3df68070ff5e8","observation_id":"adc1acb2-2eac-4a54-aaae-e125d852bd85","resolution":{"observed_at":"2026-08-08T18:01:17.469017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-08T18:01:16.672794Z","title":"Sam 2: Segment anything in images and videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.672794Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:a7f70c928729e185d7de104a9bfc42a917628f33c3fbace7535e3e6f2f7c9467","observation_id":"a13e96ae-e07b-4b61-b85f-7cf605259994","resolution":{"observed_at":"2026-08-08T18:01:16.672794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.457443Z","title":"Vitpose: Simple vision transformer baselines for human pose estimation,","venue":null,"work_id":"9c2a6f5e-ebeb-49d3-855e-2da94d381bdd","year":2022},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.677011Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:b48399385d44acc4d807ac7c3d0f67d711605dd04e5731fdb27c677632c36e9d","observation_id":"337de9e0-c609-4eae-a8f2-0ee84ca9dd0f","resolution":{"observed_at":"2026-08-08T18:01:17.460517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11831","last_updated":"2024-10-15T17:56:32Z","snapshot_observed_at":"2026-08-10T09:33:44.765528Z","submitted_at":"2024-10-15T17:56:32Z","title":"CoTracker3: Simpler and Better Point Tracking by Pseudo-Labelling Real Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11831","snapshot_observed_at":"2026-08-08T18:01:16.679697Z","title":"Cotracker3: Simpler and better point tracking by pseudo-labelling real videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.679697Z"},"links":{"cited_paper":"/paper/2410.11831","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:a69cee1d302deb93a7be935aee5f3070db4459baea74ce971505d0f540ba7d8e","observation_id":"2d4fac88-8ece-43a2-b2b5-32513591a9f8","resolution":{"observed_at":"2026-08-08T18:01:16.679697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10034","last_updated":"2024-07-14T00:53:14Z","snapshot_observed_at":"2026-08-10T02:16:19.143136Z","submitted_at":"2024-07-14T00:53:14Z","title":"Partial Implementation of Max Flow and Min Cost Flow in Almost-Linear Time","version":1},"cited_work":{"arxiv_id":"2407.10034","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.10034","snapshot_observed_at":"2026-08-08T18:01:16.979801Z","title":"Partial Implementation of Max Flow and Min Cost Flow in Almost-Linear Time","venue":"cs.DS","work_id":"2423c2f1-5b65-4132-9843-9b51df7a0ce8","year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.683535Z"},"links":{"cited_paper":"/paper/2407.10034","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:a0905b2c9ca695b18dfa04f43143103fc7266c5c5f711fca966c65646a080629","observation_id":"e644f7fe-012b-4b8d-838f-6ced7cd0d4b5","resolution":{"observed_at":"2026-08-08T18:01:16.982789Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.449084Z","title":"Egohos: Dataset and method for hand and object segmentation in egocentric videos,","venue":null,"work_id":"d3b0616c-c97c-47ba-9f0b-21fff05a0fda","year":2022},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.690128Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:63c405d5acf341250b393257fd459f0f001b1a22eff7582b114ba9c7be6203e0","observation_id":"ddd8f7f0-4eae-4885-b123-7ec83f4881a5","resolution":{"observed_at":"2026-08-08T18:01:17.452196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03897","last_updated":"2023-09-07T17:57:29Z","snapshot_observed_at":"2026-07-06T16:15:50.904062Z","submitted_at":"2023-09-07T17:57:29Z","title":"ProPainter: Improving Propagation and Transformer for Video Inpainting","version":1},"cited_work":{"arxiv_id":"2309.03897","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.03897","snapshot_observed_at":"2026-08-08T18:01:16.968600Z","title":"ProPainter: Improving Propagation and Transformer for Video Inpainting","venue":"cs.CV","work_id":"ce7c5bdf-ad48-4424-bac6-b96380822ee8","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.693925Z"},"links":{"cited_paper":"/paper/2309.03897","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:e43cf722a3c6401c7fe95d45814e82e4805c42efa41a83db33edd20819397d4b","observation_id":"cb7605e1-a217-4fb8-9ca8-f5a21f108487","resolution":{"observed_at":"2026-08-08T18:01:16.971566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02546","last_updated":"2025-07-03T11:40:01Z","snapshot_observed_at":"2026-07-06T21:51:38.554688Z","submitted_at":"2025-07-03T11:40:01Z","title":"MoGe-2: Accurate Monocular Geometry with Metric Scale and Sharp Details","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02546","snapshot_observed_at":"2026-08-08T18:01:16.698219Z","title":"Moge-2: Accurate monocular geometry with metric scale and sharp details,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.698219Z"},"links":{"cited_paper":"/paper/2507.02546","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:8256cb4ea10fc3bda8a9f9b58b39245a231139f3476dcccbc06125be83dab1c3","observation_id":"eecb27d4-4607-4903-aad2-264f6ab5d6c0","resolution":{"observed_at":"2026-08-08T18:01:16.698219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.429597Z","title":"Structure-from-motion revisited,","venue":null,"work_id":"457cc632-c0ea-4a59-9e21-bd0f71517319","year":2016},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.701629Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:4ea1e4e955e114cbd812a5c24b0e6194dfbc98fea9d5e30495ce35fe677ad19d","observation_id":"2799165f-53ac-4ec4-8364-369b457b7872","resolution":{"observed_at":"2026-08-08T18:01:17.443547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.386845Z","title":"Droid-slam: Deep visual slam for monocular, stereo, and rgb-d cameras,","venue":null,"work_id":"a166e2bf-588e-4df0-ae33-f80084aed5ec","year":2021},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.704962Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:51f9b8d982cbb413fd09924fad6fd86ce8a5e4d4a8c171637a6687d78d585667","observation_id":"b735d328-27e1-415b-974e-7dfae58a4a13","resolution":{"observed_at":"2026-08-08T18:01:17.404213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03904","last_updated":"2024-03-25T18:02:25Z","snapshot_observed_at":"2026-07-06T16:58:03.812619Z","submitted_at":"2023-12-06T20:57:08Z","title":"Cosmological parameters estimated from velocity -- density comparisons: Calibrating 2M++","version":2},"cited_work":{"arxiv_id":"2312.03904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.03904","snapshot_observed_at":"2026-08-08T18:01:16.943551Z","title":"Cosmological parameters estimated from velocity -- density comparisons: Calibrating 2M++","venue":"astro-ph.CO","work_id":"06108162-888a-4115-b490-19e997e3bdde","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.708765Z"},"links":{"cited_paper":"/paper/2312.03904","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:26043792b65d412aef0dc0068bbf390b57e8e1753714e9d8c5fb52b9a016ef9c","observation_id":"8759fa19-9196-41fa-aa92-4de9b38f996b","resolution":{"observed_at":"2026-08-08T18:01:16.949195Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.343200Z","title":"Lisa: Reasoning segmentation via large language model,","venue":null,"work_id":"154ff1d9-2ecd-49f8-8003-0ab1a5a63f97","year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.712491Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:db5c830b8ad246b61caeb483c5a65f19efe4adf5b7b48ee8e8bae35c23260635","observation_id":"fdc8a646-0858-4a01-9fd9-d9cbced9a379","resolution":{"observed_at":"2026-08-08T18:01:17.363917Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-09T18:02:17.307812Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-08T18:01:16.715426Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.715426Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:f7962f6aeb64e2c67195bae477a5f1df36b0020c43827bc1af479609abe81e33","observation_id":"79e1bd6b-7dc9-4cd2-bf84-99dc67c80cf2","resolution":{"observed_at":"2026-08-08T18:01:16.715426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-08T18:01:16.718848Z","title":"Qwen2.5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.718848Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:2c7f460898ff9b340c3d65b89aa982748c7097e1e3d7dda9f7cf5cf9326409ee","observation_id":"f23d786b-694b-4c92-a8c0-f58f8cd3218f","resolution":{"observed_at":"2026-08-08T18:01:16.718848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.305373Z","title":"Handal: A dataset of real-world manipulable object categories with pose annotations, affordances, and reconstructions,","venue":null,"work_id":"6bbff1b2-79ae-46a6-bf96-5df936456fcd","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.722078Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:36513e6c4a94223220ada13c4f5b95a351627b645fed3a4aade9e2a5d356be1c","observation_id":"cfd00c33-f0af-4c47-b0ff-dac2de245f0c","resolution":{"observed_at":"2026-08-08T18:01:17.322968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.271764Z","title":"Scenefun3d: Fine-grained functionality and affor- dance understanding in 3d scenes,","venue":null,"work_id":"d3bf0116-d59e-4c7c-89bb-a555380fa0fc","year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.724875Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:d6cfd18d50b73ba3e6f676056d8d0214daa62ee3748c32d8606a5fef79705853","observation_id":"c2c8c255-f4fe-4369-bd13-4008e10a089d","resolution":{"observed_at":"2026-08-08T18:01:17.283009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.263105Z","title":"Understanding 3d object interaction from a single image,","venue":null,"work_id":"1d21630b-6608-458e-bd5b-603f4b97e0f0","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.728322Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:c0c7cf95c9f4ce26b72b68f25a9cd4a0cc0e6a279d3cea5bd08338db03c1cf16","observation_id":"9d6cb10d-c1e1-4346-a1e3-342f08dc0d22","resolution":{"observed_at":"2026-08-08T18:01:17.266440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04689","last_updated":"2024-07-05T17:50:38Z","snapshot_observed_at":"2026-08-10T04:59:08.356040Z","submitted_at":"2024-07-05T17:50:38Z","title":"RAM: Retrieval-Based Affordance Transfer for Generalizable Zero-Shot Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04689","snapshot_observed_at":"2026-08-08T18:01:16.731423Z","title":"Ram: Retrieval-based affordance transfer for generalizable zero-shot robotic manipulation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.731423Z"},"links":{"cited_paper":"/paper/2407.04689","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:388d289a46e332b007177cca52ec3f510874c418794b053df2c3cd142055319f","observation_id":"c0fc3ebb-0e0f-44b9-ab11-b8af73969e03","resolution":{"observed_at":"2026-08-08T18:01:16.731423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:16.735394Z","title":"Generalflow: Generalizable manipulation policy with flow matching,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.735394Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:f51cf4db84fa352d30fecd56959d9f7a36dc8aaf2b8bb6c57d68a9714398d6d9","observation_id":"10f87d64-38e4-41bd-83c1-e9b623a85cea","resolution":{"observed_at":"2026-08-08T18:01:16.735394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.254413Z","title":"Graspnet-1billion: A large-scale benchmark for general object grasping,","venue":null,"work_id":"27e5f875-4583-4a7d-9528-4d6a92a103fb","year":2020},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.739749Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:ddacf6946c07b26a7a51d943cd1362ce1f15163a1ab108514fdd5c74b4b40b8a","observation_id":"dbce1271-1683-4f1c-ae77-aded962f06e7","resolution":{"observed_at":"2026-08-08T18:01:17.257624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.245968Z","title":"R+x: Retrieval and execution from everyday human videos,","venue":null,"work_id":"cfcce9c5-15a8-40b0-b370-c413e8c3bc9e","year":2025},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.744681Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:b4133ce88a3fb2daf0dd956f7d347a98821fdd24961b5cc8e3cb4111f1b6ff45","observation_id":"0ce24f75-d874-4b80-8241-2dc6602ccc45","resolution":{"observed_at":"2026-08-08T18:01:17.249151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.10470","last_updated":"2021-08-25T23:42:59Z","snapshot_observed_at":"2026-07-06T11:40:56.544714Z","submitted_at":"2021-08-24T01:38:11Z","title":"Isaac Gym: High Performance GPU-Based Physics Simulation For Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.10470","snapshot_observed_at":"2026-08-08T18:01:16.749849Z","title":"Isaac gym: High performance gpu- based physics simulation for robot learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.749849Z"},"links":{"cited_paper":"/paper/2108.10470","citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:128476a49e936a2f6b6626f658a3aaa97c9735486566d21ce609973e96199fb2","observation_id":"8a16cb37-f10f-40e4-ac25-7ee8770c1759","resolution":{"observed_at":"2026-08-08T18:01:16.749849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.236230Z","title":"Partmanip: Learning cross-category generalizable part manipulation policy from point cloud observations,","venue":null,"work_id":"da736720-44f0-440f-a57f-9c4a2883de73","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.756165Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:8d03ee7d84ad2a352e89a3ffe53079a79734cf216dbfd75c881643c5f033ddf6","observation_id":"43ecab4d-afdc-401c-8985-05abc85f90dc","resolution":{"observed_at":"2026-08-08T18:01:17.239675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.226728Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning,","venue":null,"work_id":"54b255e5-3d16-41d2-bbd1-f3b676003a30","year":2019},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.762422Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:87246a410284af4dab55223b77d3ebac357d6e85fc435a79cb5fe3c1804423d5","observation_id":"4c206d36-488b-4132-8b50-3d28cd05b34c","resolution":{"observed_at":"2026-08-08T18:01:17.230123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.217320Z","title":"Maniskill2: A unified benchmark for generalizable manipulation skills,","venue":null,"work_id":"f1f5af7f-1c49-469b-be6b-f93f8159b103","year":2023},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.769923Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:88e0a10435319c69a496bde9c7b4726165143c661161031775a839c066e29f80","observation_id":"4f11054a-a739-4ca8-b5d3-3f2795a44ca0","resolution":{"observed_at":"2026-08-08T18:01:17.220850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.207741Z","title":"Ag2manip: Learning novel manipulation skills with agent-agnostic visual and action representations,","venue":null,"work_id":"c20ebdb1-0b53-4711-95f5-edca88b88a56","year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.773180Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:909bc3ff0ca6c18276ec9c430938204baa1d3d004ff352c226c814d2aaf8d063","observation_id":"c3de1a73-28dc-4f25-afe4-a991ea4a3205","resolution":{"observed_at":"2026-08-08T18:01:17.211220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.197150Z","title":"Pointllm: Empowering large language models to understand point clouds,","venue":null,"work_id":"d3b95621-3ba9-45bb-86a4-787d2f9f0d61","year":2024},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.777002Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:a865901c29e42736764ef14b97a008b16b9664506a869d14b6396673a929c05e","observation_id":"97febfe7-476a-474b-bd2e-eb2a8fc6ef54","resolution":{"observed_at":"2026-08-08T18:01:17.200369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:01:17.162467Z","title":"Generating 6dof object manipulation trajectories from action description in egocentric vision,","venue":null,"work_id":"f7bcfc3c-e540-4621-b02d-aa6a92c7cb18","year":2025},"citing_paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T18:01:16.779978Z"},"links":{"citing_paper":"/paper/2608.05215"},"observation_digest":"sha256:4042fb6a566419a055e7d9a3dbf572e234e8e2aa6964cdbb5f45c60669462ecd","observation_id":"a4e6b661-3308-4060-b8a1-0d8ecb8ecdc7","resolution":{"observed_at":"2026-08-08T18:01:17.190849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.05215","last_updated":"2026-08-05T10:15:55Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-09T23:10:18.883068Z","submitted_at":"2026-08-05T10:15:55Z","title":"VLAff: Vision-Language-Affordance Model for Unified Actionable Affordances"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":28,"verified_exact":2,"verified_fuzzy":39},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 0 inbound Pith citation observations for arXiv:2608.05215."}