{"as_of":"2026-08-10T23:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9ba9948ce68da2b87582ebd0ad5e1a9e4a52e12e3785d2eeb6a3617058ce99f","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T23:34:00.189733Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2603.04419/citation-record","integrity":"/paper/2603.04419/integrity","json":"/paper/2603.04419/citation-record.json","paper":"/paper/2603.04419"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:55.493618Z","title":"Do as I can, not as I say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:55.493618Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:1a1d8daa90930fdf7313ca2d301dfee1357ad960ce3a3bdccfb58d3a485e09a0","observation_id":"0a08630b-a291-4f66-b4be-b8c6291b8f92","resolution":{"observed_at":"2026-08-02T23:33:55.493618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-02T23:33:55.651971Z","title":"Qwen-VL : A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:55.651971Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:a6a12b3fd29c44e755cba487c4f3a469283cda3489415c6733e78f634d8b0639","observation_id":"7cd11574-76e3-40eb-bd1c-e1bc13598804","resolution":{"observed_at":"2026-08-02T23:33:55.651971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:55.818914Z","title":"Bender and Alexander Koller","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:55.818914Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:964e924377716bff969314d54bfc35d40c797ca6af8efcd792e8851d4ef9829e","observation_id":"0839a113-8030-41b1-81c9-bc844b3ca347","resolution":{"observed_at":"2026-08-02T23:33:55.818914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:55.890323Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:55.890323Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:3ab16fab37286399225ca0438c0a15c2d0b4ef19c1d47650e16fb49beefabe6e","observation_id":"623c3f02-a707-4330-9a2e-0c5e1672980e","resolution":{"observed_at":"2026-08-02T23:33:55.890323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:55.982664Z","title":"An outline of a theory of affordances","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:55.982664Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:da888d6906b3448d0672967346b5ab36ab71dac89d96383d5b724e81d7e88a7d","observation_id":"efe5b220-d288-4238-a6d8-a8f9a77e5994","resolution":{"observed_at":"2026-08-02T23:33:55.982664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:56.180935Z","title":"Cortical mechanisms of action selection: The affordance competition hypothesis","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:56.180935Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:b0bc24445ef39c42e875d4bc704e8bd8dda487499842da55fd9ae5b4dcfadc3e","observation_id":"0ceb77d5-c014-40fd-ae75-54a82a10db3b","resolution":{"observed_at":"2026-08-02T23:33:56.180935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:56.352683Z","title":"Being There: Putting Brain, Body, and World Together Again","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:56.352683Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:769b919d1b3222c07e85b820e533025b1a5764da65d33742402230deb1465ca4","observation_id":"3ce0eec4-26da-4d3d-b801-e91f9500d685","resolution":{"observed_at":"2026-08-02T23:33:56.352683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:56.571246Z","title":"Whatever next? P redictive brains, situated agents, and the future of cognitive science","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:56.571246Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:ee30b2ecffa8274245bf3b7582c89281aee9dcb83e46dc4b67739f55e9451f40","observation_id":"78d3a736-1384-461d-978a-c17c0260b748","resolution":{"observed_at":"2026-08-02T23:33:56.571246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:56.753738Z","title":null,"venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:56.753738Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:231a83cdbcf845557bdf40561c9a540518c1c9c58e18fc7297cd62f10babd924","observation_id":"e5603b98-b56e-4d8d-a74b-3756d1c01002","resolution":{"observed_at":"2026-08-02T23:33:56.753738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:56.899842Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:56.899842Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:0cd0d89b169c2b35f7aae53fc2b9f1c4d20d75835e2a1cf1e6cff5b0f804bf04","observation_id":"09d2787e-e93b-4956-a7ef-df9d0ded43a8","resolution":{"observed_at":"2026-08-02T23:33:56.899842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.21203/rs.3.rs-8634152/v1","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training data and the maladaptive mind: A computational framework for developmental trauma","venue":"Research Square","work_id":"8b0a4d2b-4ead-4685-b415-2c2212db83e5","year":2025},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:57.051342Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:e7a4b0f4f9f802934353904698d6a38d8f0e23f0d9e56aa40cec5d75d73136e2","observation_id":"c19b82d9-9ec7-4323-8b13-ed02c080ca3b","resolution":{"observed_at":"2026-08-02T23:38:25.589710Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:57.127061Z","title":null,"venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:57.127061Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:9bc99b8d7998d4130d8ccbd2f80b9495af47a0c1d57291c6d26693309a31e5fb","observation_id":"690ad13b-2cb5-474e-9205-661493376c08","resolution":{"observed_at":"2026-08-02T23:33:57.127061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:57.192924Z","title":null,"venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:57.192924Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:fe727b203355ced6ac9a2b3808cd2dd34b32c1fe612a4974fe37ce7deb4fcaa7","observation_id":"170d8ca7-14c5-48cb-8818-2013b2515280","resolution":{"observed_at":"2026-08-02T23:33:57.192924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/aaai.12194","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Towards robust visual understanding: A paradigm shift in computer vision from recognition to reasoning","venue":"AI Magazine","work_id":"4f1972d3-3234-4a1a-a593-16f7bf22fa1f","year":2024},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:57.260310Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:8ccf7abaab615e84cc5d17ade02a88418cc7c2bbb3d74ba3a6c3a4d362d10dbb","observation_id":"850cb33b-1b93-4fc9-a021-f75e7c29b4ea","resolution":{"observed_at":"2026-08-02T23:38:25.354652Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:57.338836Z","title":"Goodale and A","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:57.338836Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:b9e1f655d486210cd58f42a81e64597ba5e6722688705d977598d872337d22ce","observation_id":"1ded26a3-2300-41e6-bcb5-3f202a1af69c","resolution":{"observed_at":"2026-08-02T23:33:57.338836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3446370","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual affordance and function understanding: A survey","venue":"ACM Computing Surveys","work_id":"2f3f4e9c-6037-47a1-a27f-555dd66073ce","year":2022},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:57.416666Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:fa2570a7cf824c62b596c9069fccac2e47adc74533801fb34506fdc779ee4f3f","observation_id":"04a39869-9c52-45eb-8a4b-f526a000bcf7","resolution":{"observed_at":"2026-08-02T23:38:25.047739Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:57.496034Z","title":"Sein und Zeit","venue":null,"work_id":null,"year":1927},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:57.496034Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:115ea7b0ff2406ad553c54402cf8e089d789070cece9ead179d604792acbf706","observation_id":"ead19807-63dd-4468-a88d-4e32c31dd4b2","resolution":{"observed_at":"2026-08-02T23:33:57.496034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16082","last_updated":"2024-11-25T04:22:33Z","snapshot_observed_at":"2026-07-06T19:56:21.333277Z","submitted_at":"2024-11-25T04:22:33Z","title":"Leverage Task Context for Object Affordance Ranking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16082","snapshot_observed_at":"2026-08-02T23:33:57.613173Z","title":"Leverage task context for object affordance ranking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:57.613173Z"},"links":{"cited_paper":"/paper/2411.16082","citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:8383df69f6e94625af72b0853223a663d1209b23f3da6f745d19d6dfd19be9c8","observation_id":"908ee76e-008d-4e05-94a6-994ee8a6b260","resolution":{"observed_at":"2026-08-02T23:33:57.613173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:57.671964Z","title":"VoxPoser : Composable 3D value maps for robotic manipulation with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:57.671964Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:9c9f21c7e6445000b1f1d3b72270aa572472085f5dfdaeaa62a5bbf5ef143632","observation_id":"e8cc3324-41ac-4552-be8a-872d30b07921","resolution":{"observed_at":"2026-08-02T23:33:57.671964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:57.740934Z","title":"Shamma, et al","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:57.740934Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:9cf5c6a21f19dbcba39cdfef0102b0de934d31694167ccfd8943b14cf710ae29","observation_id":"b827c437-7200-459f-9d81-7187fa1bf6de","resolution":{"observed_at":"2026-08-02T23:33:57.740934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:57.831542Z","title":"Lawrence Zitnick","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:57.831542Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:3c42b73adcf7ed77b5a04b8b849a4bff0f133a40c5e92d285e8c2ae1e4ebd9eb","observation_id":"cfbf1919-934c-4764-b4de-d84e97ef7781","resolution":{"observed_at":"2026-08-02T23:33:57.831542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:57.918971Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:57.918971Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:ae359f9484846c2feef8f828247ad05224a6ed98a33d44870779be31f7f662c4","observation_id":"149ae2a7-98c0-4f94-8614-2d3bb8e577d6","resolution":{"observed_at":"2026-08-02T23:33:57.918971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:57.999402Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:57.999402Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:2fa1e88dbd11ca93dfd570379f9cd7a33ebeab24f4aea1236bedd138626c8343","observation_id":"bd31e079-50b3-4e9c-aaae-e731f70508a4","resolution":{"observed_at":"2026-08-02T23:33:57.999402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:58.099173Z","title":"Ph \\'e nom \\'e nologie de la Perception","venue":null,"work_id":null,"year":1945},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:58.099173Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:4e8ff98afcb693e0c6c2a9ebd986cf6f77791645838991827392639bcf7b4e21","observation_id":"5c2fddd8-d4d4-4b5f-b98e-b163c3c08f15","resolution":{"observed_at":"2026-08-02T23:33:58.099173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1152/jn.1997.78.4.2226","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Object representation in the ventral premotor cortex (area F5 ) of the monkey","venue":"Journal of Neurophysiology","work_id":"73aeb878-95ec-4fbb-826f-7e27b253984c","year":1997},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:58.180426Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:d287cf537b1dac0e800a9292de2f17f00efa5cdd011737bf05a882d2948230f9","observation_id":"4d28cfb0-23bd-4d1c-a0be-40615076bdbc","resolution":{"observed_at":"2026-08-02T23:38:24.870720Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02704","last_updated":"2024-11-05T01:02:51Z","snapshot_observed_at":"2026-08-10T12:42:09.036227Z","submitted_at":"2024-11-05T01:02:51Z","title":"RT-Affordance: Affordances are Versatile Intermediate Representations for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02704","snapshot_observed_at":"2026-08-02T23:33:58.233101Z","title":"RT-Affordance : Affordances are versatile intermediate representations for robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:58.233101Z"},"links":{"cited_paper":"/paper/2411.02704","citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:4fff8f97e873c5505290776f8e9ecc0427bad9aaafff8633fc1ec5aa2caf28af","observation_id":"4505ac3e-c727-44cb-bddb-7c72aee0f127","resolution":{"observed_at":"2026-08-02T23:33:58.233101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:58.316571Z","title":"Caldwell, and Nikos G","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:58.316571Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:66c07e9767da181ec9e2098481623d5e2d5ea848128000d2cffff71ad5b6a01c","observation_id":"6ddc4734-991c-4b2f-8d9f-afc424a6ff48","resolution":{"observed_at":"2026-08-02T23:33:58.316571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:58.431943Z","title":"Action in Perception","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:58.431943Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:4a09dd513886efb400ec018be3d38a227d3801d9632b7dfdd91b516d8d9f4d53","observation_id":"302df799-f477-409a-b5bb-5972ab2d8239","resolution":{"observed_at":"2026-08-02T23:33:58.431943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:58.507213Z","title":"Kevin O'Regan and Alva No \\\"e","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:58.507213Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:78a826debf643ee780c8408c619281ca438abac73ea3601aced7e3e73aa84a0d","observation_id":"8838b9a6-eb50-466b-b097-5916e05ad64f","resolution":{"observed_at":"2026-08-02T23:33:58.507213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:58.600715Z","title":"AffordanceLLM : Grounding affordance from vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:58.600715Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:0d603892a740b8b921828a09ecf731974bd216b0bc4fa761a7f51610a0ea4216","observation_id":"d489e636-4bc3-4b7d-b035-49838a56ab42","resolution":{"observed_at":"2026-08-02T23:33:58.600715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:58.653485Z","title":"Sentence- BERT : Sentence embeddings using S iamese BERT -networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:58.653485Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:b238a50434c6223f5f1a33d9f4ef0d9b7e4a1c723d569e54a543f99e7806a945","observation_id":"b7c4ab0b-df54-4a95-a013-4111815da978","resolution":{"observed_at":"2026-08-02T23:33:58.653485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:58.713379Z","title":"The mirror-neuron system","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:58.713379Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:ed881f446156d3a7cf21f06e92d0557d9e5e02228264b77b51433753747e07bb","observation_id":"f6f2adfc-9aa9-4bbd-94f9-97b3e84ff031","resolution":{"observed_at":"2026-08-02T23:33:58.713379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1002/widm.70036","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A survey on efficient vision-language models","venue":"Wiley Interdisciplinary Reviews Data Mining and Knowledge Discovery","work_id":"0dae9041-c8a5-44e3-9aba-a2b200a08fbf","year":2025},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:58.772103Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:7aea75a77eabf7197f850726ff15de5ddb42daf2c34d002d75e4543dde7e6437","observation_id":"cb015ea8-0c00-45e9-987b-d5dd1d219b3b","resolution":{"observed_at":"2026-08-02T23:38:24.605386Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:58.857810Z","title":"Simons and Christopher F","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:58.857810Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:b660be44852a3d87271f8a947c8e8b59fd255230f5edfde866c17484f6b3c5a4","observation_id":"1f36eccc-a6c9-40ad-b679-b2036c3c2b1e","resolution":{"observed_at":"2026-08-02T23:33:58.857810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1207/s15326969eco1502_2","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Stoffregen","venue":"Ecological Psychology","work_id":"a9ba0268-277d-4b4c-8c44-9787a2383ee7","year":2003},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:58.964744Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:0611356deb655b85c9d31aa6817dda5bf8c1c6ac25430157056fc26e6bb0e96b","observation_id":"ebf0e6de-9a36-4f63-b4ed-c1f79227144c","resolution":{"observed_at":"2026-08-02T23:38:24.298175Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3758/s13421-025-01848-0","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Differential effects of contextual congruency on recognition and retrieval of perceptual details","venue":"Memory & Cognition","work_id":"b5e33f49-3d45-4f5e-93f8-01b14b5a2748","year":2026},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:59.136583Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:834cc5551006558005b7a950dee2f65e64f22cfb446a1cd890ee3f82958707ed","observation_id":"1a4fff0d-8259-4faf-b030-d2a4d363f907","resolution":{"observed_at":"2026-08-02T23:38:23.999778Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:59.298090Z","title":"Mind in Life: Biology, Phenomenology, and the Sciences of Mind","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:59.298090Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:84403ff55081e698478ba28344375eb57b27d2ef6bbc0926946f9d051002bccc","observation_id":"dda83e79-90f2-4f3d-8c60-6d35cdfe8b0a","resolution":{"observed_at":"2026-08-02T23:33:59.298090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:59.492666Z","title":null,"venue":null,"work_id":null,"year":1966},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:59.492666Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:893d1e20eb305336604d8275ce90ed605d94a34b77ce587cda31ee13c321ed2d","observation_id":"4c27d538-6513-4184-8213-875a3ed30b57","resolution":{"observed_at":"2026-08-02T23:33:59.492666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1207/s15326969eco0403_3","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Ecological Psychology","work_id":"d50e46cc-a455-42d1-ae17-d567a3dce332","year":1992},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:59.599342Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:bd663c47c0c86f41e7ad75053302b9d18907896864bbe22562d99b49d13e9358","observation_id":"c978557c-4ca1-45dc-b513-555fcd3de873","resolution":{"observed_at":"2026-08-02T23:38:23.838671Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:33:59.719204Z","title":"Varela, Evan Thompson, and Eleanor Rosch","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:59.719204Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:513b5bb5fb3231eadfe8d7fc82e8b4b4a80fd9148de4f873f7f1267cd19a9b01","observation_id":"90cd00f5-f312-4c2b-8d28-1c54f36ecb22","resolution":{"observed_at":"2026-08-02T23:33:59.719204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr.2017.330","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Choy, and Li Fei-Fei","venue":null,"work_id":"6eb24a49-0d52-40ad-baea-0096ce7991bc","year":2017},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-02T23:33:59.895079Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:fb9a8727aa446710e18860c85a31fffa31f999e7d4c99d9402a24822b973f214","observation_id":"07bd73fd-4593-4bae-bb74-543afec38970","resolution":{"observed_at":"2026-08-02T23:38:23.666677Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:34:00.028053Z","title":"RoboPoint : A vision-language model for spatial affordance prediction for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-02T23:34:00.028053Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:364438718e4587c4eb98b95361271918e9abac4c4b21d6a94486862ebb9abd6c","observation_id":"038c905c-7887-48ee-b191-5119a50bc0e0","resolution":{"observed_at":"2026-08-02T23:34:00.028053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05603","last_updated":"2024-04-08T15:22:38Z","snapshot_observed_at":"2026-07-06T17:57:14.899058Z","submitted_at":"2024-04-08T15:22:38Z","title":"Self-Explainable Affordance Learning with Embodied Caption","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05603","snapshot_observed_at":"2026-08-02T23:34:00.107212Z","title":"Self-explainable affordance learning with embodied caption","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-02T23:34:00.107212Z"},"links":{"cited_paper":"/paper/2404.05603","citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:2360fdcfc5e801412bc6a01e38c9c03ea5ee5ef2b4861bfb95a1e06f43e15404","observation_id":"7833994d-049f-48ac-98a2-d65844aef536","resolution":{"observed_at":"2026-08-02T23:34:00.107212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T23:34:00.189733Z","title":"Places: A 10 million image database for scene recognition","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-02T23:34:00.189733Z"},"links":{"citing_paper":"/paper/2603.04419"},"observation_digest":"sha256:fa8dd1a527ccfe91b642f6139447c56429b9ce443bf7285d0e9e2f3ba9c365b9","observation_id":"c1d4f3dc-f28e-41b1-884a-ad599642460e","resolution":{"observed_at":"2026-08-02T23:34:00.189733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.04419","last_updated":"2026-07-11T22:36:19Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T12:44:41.818416Z","submitted_at":"2026-02-14T04:22:00Z","title":"Context-Dependent Affordance Computation in Vision-Language Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":9,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2603.04419."}