{"as_of":"2026-08-21T02:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:016201a0f8afde52cb82c9cf25796442d2f8082b2e087279b7970268ee04955e","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:04:43.614955Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T16:40:22.441025Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T16:44:56.014838Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2602.15892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.15892","snapshot_observed_at":"2026-07-15T02:22:00.923596Z","title":"Egocentric bias in vision-language models","venue":null,"work_id":"d2f276da-fada-43b2-a32b-623ce1133706","year":2026},"citing_paper":{"arxiv_id":"2605.12413","last_updated":"2026-05-18T10:53:40Z","snapshot_observed_at":"2026-08-13T19:15:20.696252Z","submitted_at":"2026-05-12T17:11:17Z","title":"Beyond Localization: A Comprehensive Diagnosis of Perspective-Conditioned Spatial Reasoning in MLLMs from Omnidirectional Images","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T06:56:37.792662Z"},"links":{"cited_paper":"/paper/2602.15892","citing_paper":"/paper/2605.12413"},"observation_digest":"sha256:ba105e465641023a1450ff5fbbea5871fa3589054fb54631235dd1b4f026011d","observation_id":"7ba2d836-0e60-4bcf-9ff4-888e696529a9","resolution":{"observed_at":"2026-07-15T02:22:00.923596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2602.15892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.15892","snapshot_observed_at":"2026-07-15T02:22:00.923596Z","title":"Egocentric bias in vision-language models","venue":null,"work_id":"d2f276da-fada-43b2-a32b-623ce1133706","year":2026},"citing_paper":{"arxiv_id":"2605.12413","last_updated":"2026-05-18T10:53:40Z","snapshot_observed_at":"2026-08-13T19:15:20.696252Z","submitted_at":"2026-05-12T17:11:17Z","title":"Beyond Localization: A Comprehensive Diagnosis of Perspective-Conditioned Spatial Reasoning in MLLMs from Omnidirectional Images","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-14T21:38:09.573431Z"},"links":{"cited_paper":"/paper/2602.15892","citing_paper":"/paper/2605.12413"},"observation_digest":"sha256:5366db3a693a82ef251661ed0eb147f5ddbe48d4b5911a05e7ebb7a89b05cd10","observation_id":"b509e59d-db5b-41b2-bb84-1c184def6c4f","resolution":{"observed_at":"2026-07-15T02:22:00.923596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2602.15892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.15892","snapshot_observed_at":"2026-07-15T02:22:00.923596Z","title":"Egocentric bias in vision-language models","venue":null,"work_id":"d2f276da-fada-43b2-a32b-623ce1133706","year":2026},"citing_paper":{"arxiv_id":"2605.12413","last_updated":"2026-05-18T10:53:40Z","snapshot_observed_at":"2026-08-13T19:15:20.696252Z","submitted_at":"2026-05-12T17:11:17Z","title":"Beyond Localization: A Comprehensive Diagnosis of Perspective-Conditioned Spatial Reasoning in MLLMs from Omnidirectional Images","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T22:24:38.232462Z"},"links":{"cited_paper":"/paper/2602.15892","citing_paper":"/paper/2605.12413"},"observation_digest":"sha256:223ef11dd222fba968be875c19d3e92c1773d07738fa33fb999bc5db654b2623","observation_id":"064d3239-6546-462c-861b-60345e693c89","resolution":{"observed_at":"2026-07-15T02:22:00.923596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2602.15892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.15892","snapshot_observed_at":"2026-07-15T02:22:00.923596Z","title":"Egocentric bias in vision-language models","venue":null,"work_id":"d2f276da-fada-43b2-a32b-623ce1133706","year":2026},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-25T05:10:32.522453Z"},"links":{"cited_paper":"/paper/2602.15892","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:f63c3f0cb572b7edbea6fb758109dfe24151a9aa6769bb593a1ca0b846346adf","observation_id":"83bfce57-e662-4767-8d1e-cdfc9704c57b","resolution":{"observed_at":"2026-07-15T02:22:00.923596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2602.15892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.15892","snapshot_observed_at":"2026-07-15T02:22:00.923596Z","title":"Egocentric bias in vision-language models","venue":null,"work_id":"d2f276da-fada-43b2-a32b-623ce1133706","year":2026},"citing_paper":{"arxiv_id":"2605.23176","last_updated":"2026-06-15T18:43:33Z","snapshot_observed_at":"2026-08-18T11:09:47.441160Z","submitted_at":"2026-05-22T02:52:06Z","title":"DRIVESPATIAL: A Benchmark for Spatiotemporal Intelligence in VLMs for Autonomous Driving","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-30T16:40:22.441025Z"},"links":{"cited_paper":"/paper/2602.15892","citing_paper":"/paper/2605.23176"},"observation_digest":"sha256:445ed2b9f16610e12bdcba084abf332bc0c455a0d2edf05b2681160b4c549c48","observation_id":"1dc48536-9cac-4cc0-9600-e63ee7942e78","resolution":{"observed_at":"2026-07-15T02:22:00.923596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.15892/citation-record","integrity":"/paper/2602.15892/integrity","json":"/paper/2602.15892/citation-record.json","paper":"/paper/2602.15892"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:04:42.780253Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:42.780253Z"},"links":{"citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:a318c5700b9147391bf2814c4237c926bfb473ccecb139c3857a79f722417dce","observation_id":"05849681-3d65-436e-9cf1-1d5fb1798736","resolution":{"observed_at":"2026-08-03T03:04:42.780253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-03T03:04:42.810709Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:42.810709Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:d07b8db2b25a4360d867a45881d6eec3471610696007bbeb6f979d975b0235e3","observation_id":"48b214bd-ef66-46c6-8f5c-f6620eec74c9","resolution":{"observed_at":"2026-08-03T03:04:42.810709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00855","last_updated":"2024-10-30T14:45:00Z","snapshot_observed_at":"2026-08-19T09:51:53.292060Z","submitted_at":"2024-10-30T14:45:00Z","title":"Vision-Language Models Can Self-Improve Reasoning via Reflection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00855","snapshot_observed_at":"2026-08-03T03:04:42.848005Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:42.848005Z"},"links":{"cited_paper":"/paper/2411.00855","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:eab82a52b1b325d28638b499c9d160a9a1c874bc041c38093f7418097eb49f3e","observation_id":"b30df57e-bffb-4bb0-bd10-25d1c9211092","resolution":{"observed_at":"2026-08-03T03:04:42.848005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-03T03:04:42.883514Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:42.883514Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:b8f060d35ef1bc7af3612787d16b30102cc5b8327415780132df0a1626bbc17d","observation_id":"83e0bc5b-6d3f-4b9c-80eb-3621c0c375c5","resolution":{"observed_at":"2026-08-03T03:04:42.883514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:04:42.914364Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:42.914364Z"},"links":{"citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:89aa93a65d5c9d964a8e1d2e864f432c56fb9e62fd34ffc16510dffb347a682f","observation_id":"ce416726-0e3b-4f8f-87c9-b70aa37667ad","resolution":{"observed_at":"2026-08-03T03:04:42.914364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:04:42.945428Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:42.945428Z"},"links":{"citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:217c89dbdeb5dfa6479b29064fa3c73a9ba696b42626582eb7a312e7f83abe12","observation_id":"53c0c413-225c-444c-b8eb-fe36e0ca2b88","resolution":{"observed_at":"2026-08-03T03:04:42.945428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-08-15T07:02:37.929930Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-08-03T03:04:42.981300Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:42.981300Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:4471d23a94c2af3e4a9a564b074ae3644d1274cbc7ad621ce7ae1dc69582f5a6","observation_id":"0ece36ae-f997-4c5f-aced-1b408dbee82a","resolution":{"observed_at":"2026-08-03T03:04:42.981300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:04:43.019547Z","title":null,"venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.019547Z"},"links":{"citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:f8d16604411184dc47cbb4e456a33b9b75d9f2103dfa0757899f0b290edeb846","observation_id":"a26120c8-bbdd-46b5-b37d-02bbee794673","resolution":{"observed_at":"2026-08-03T03:04:43.019547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:04:43.065897Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.065897Z"},"links":{"citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:d810a29738bd1460641232e2649dfc7308ae3514a876c689c3cf2920307a3ba2","observation_id":"ab3f3b7b-7c5f-4d1c-9086-ee7b4bd0ceaf","resolution":{"observed_at":"2026-08-03T03:04:43.065897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00324","last_updated":"2025-08-12T08:36:03Z","snapshot_observed_at":"2026-08-19T00:46:53.087690Z","submitted_at":"2024-10-01T01:52:01Z","title":"Vision Language Models See What You Want but not What You See","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00324","snapshot_observed_at":"2026-08-03T03:04:43.096093Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.096093Z"},"links":{"cited_paper":"/paper/2410.00324","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:c2a7c560a255c827af9ac77e776303553bbc05452d28db5022cd01ffb08d1551","observation_id":"21c28773-bd82-47f5-9e58-896f91791d1d","resolution":{"observed_at":"2026-08-03T03:04:43.096093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21876","last_updated":"2025-06-27T03:24:29Z","snapshot_observed_at":"2026-08-16T09:54:48.614134Z","submitted_at":"2025-06-27T03:24:29Z","title":"Do Vision-Language Models Have Internal World Models? Towards an Atomic Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21876","snapshot_observed_at":"2026-08-03T03:04:43.145985Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.145985Z"},"links":{"cited_paper":"/paper/2506.21876","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:82bb5a837558c9bdcab021afc3a9596ebe0af7f382b6db8be8979b0258373455","observation_id":"770e4f03-85ca-428b-9829-82fbbaaf69ce","resolution":{"observed_at":"2026-08-03T03:04:43.145985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:04:43.192285Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.192285Z"},"links":{"citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:669d76885b7c1063bb855d9efc9229423df01f2907855cc95797d2b544a61f7f","observation_id":"b1cf9659-6756-4496-8d14-05054eb45a79","resolution":{"observed_at":"2026-08-03T03:04:43.192285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.11113","last_updated":"2026-04-20T07:37:36Z","snapshot_observed_at":"2026-08-09T22:36:48.890275Z","submitted_at":"2025-11-14T09:42:42Z","title":"VIDEOP2R: Video Understanding from Perception to Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.11113","snapshot_observed_at":"2026-08-03T03:04:43.238963Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.238963Z"},"links":{"cited_paper":"/paper/2511.11113","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:da3d05da4043cb35da6df76abb4ba7c0081967fe8e47c20e7a2a9ad15a5c7adb","observation_id":"522c0fd2-df0a-4013-9ed9-b0853bb78b3e","resolution":{"observed_at":"2026-08-03T03:04:43.238963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:04:43.276828Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.276828Z"},"links":{"citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:c9ef495cdf7b266824fa7ff7d570ef53ebf36d0dc59e0e4e8693dccbc99930f7","observation_id":"3d53f10f-eda2-4151-997d-f4e84b09a285","resolution":{"observed_at":"2026-08-03T03:04:43.276828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:04:43.315495Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.315495Z"},"links":{"citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:65f47774b0533800cb13c37366474bc86f8027310f205f5a3bbedcea07b290d5","observation_id":"1af02abe-c55a-4b3f-bb65-d222839f1b43","resolution":{"observed_at":"2026-08-03T03:04:43.315495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:04:43.325113Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.325113Z"},"links":{"citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:53420e6e951a67e4a2af138f40e647ae3e427a9f46a480706ccad957106aa72a","observation_id":"e633f9ea-98f3-4d4b-b07f-b861aecd1fc6","resolution":{"observed_at":"2026-08-03T03:04:43.325113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10796","last_updated":"2020-08-01T13:11:10Z","snapshot_observed_at":"2026-08-15T01:29:44.453727Z","submitted_at":"2020-04-22T19:02:20Z","title":"VisualCOMET: Reasoning about the Dynamic Context of a Still Image","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10796","snapshot_observed_at":"2026-08-03T03:04:43.414242Z","title":"S., Bhagavatula, C., Mottaghi, R., Farhadi, A., & Choi,Y.(2020).Visualcomet:Reasoningaboutthedynamic context of a still image","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.414242Z"},"links":{"cited_paper":"/paper/2004.10796","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:49dbe2fbdfbb48d30912038214b3007cca393f45a40bd61f6809c7c86734702e","observation_id":"d9c27d6b-9de9-402c-8d3b-302b2a71f6cd","resolution":{"observed_at":"2026-08-03T03:04:43.414242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:04:43.433118Z","title":"(1954).The construction of reality in the child","venue":null,"work_id":null,"year":1954},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.433118Z"},"links":{"citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:0df46ebd2121869e09bcd1b87a26807ca04aff57fdbdab869e1acdac35e4a233","observation_id":"47a9cb1a-84d2-4846-ae73-6c98c72a68a2","resolution":{"observed_at":"2026-08-03T03:04:43.433118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:04:43.455942Z","title":"(1977).The development of thought: Equilibration of cognitive structures","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.455942Z"},"links":{"citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:6bc6b53a3a5754fc13980345fc59508e1ce849456f86f3233105759d6332d9b3","observation_id":"876493c3-77c3-4133-b5f3-e7d2ba092d01","resolution":{"observed_at":"2026-08-03T03:04:43.455942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-03T03:04:43.464172Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.464172Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:ecec1c32d0b7e1270867c8b25f3826f15536ba92ea52d5cb1e96d2917660f05b","observation_id":"328290ca-62fb-401f-a1ed-27ae1a355046","resolution":{"observed_at":"2026-08-03T03:04:43.464172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:04:43.473440Z","title":"N., & Metzler, J","venue":null,"work_id":null,"year":1971},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.473440Z"},"links":{"citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:0a13151dd8da4f38f5bb659fcf7283326e593a20966c61435223bff812314e3a","observation_id":"5304b813-b27d-4723-9083-f78d8ef37cd0","resolution":{"observed_at":"2026-08-03T03:04:43.473440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:04:43.483153Z","title":"K., Kaur, G., & Batra, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.483153Z"},"links":{"citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:3485d4ca4a1abf545d0e57e54fc8e6144165b2b9912d11bcc036ae0c266eb03a","observation_id":"da6e4ada-5d55-4a35-9628-6d848f4ab4f1","resolution":{"observed_at":"2026-08-03T03:04:43.483153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00318","last_updated":"2025-08-13T07:18:41Z","snapshot_observed_at":"2026-08-18T08:52:49.740620Z","submitted_at":"2024-10-01T01:33:10Z","title":"Probing Mechanical Reasoning in Large Vision Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00318","snapshot_observed_at":"2026-08-03T03:04:43.490707Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.490707Z"},"links":{"cited_paper":"/paper/2410.00318","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:ae0e09c39740ddebf39a99223785c13645050d3b57e9f1d0925e89470943c550","observation_id":"7ba98268-aaf1-4f1a-93da-3f5d2bb94c49","resolution":{"observed_at":"2026-08-03T03:04:43.490707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:04:43.502367Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.502367Z"},"links":{"citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:3c9f382119e3ba140d1372f4ebc2cc74a7e7b140dacf323d2bef0b88d9b66f18","observation_id":"337ad77a-edd9-4a6f-b609-df5df163e1f3","resolution":{"observed_at":"2026-08-03T03:04:43.502367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:04:43.510336Z","title":"J., & Pinker, S","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.510336Z"},"links":{"citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:3e63389c9416f375a866b8108f1ad7d0559334cdd0d79a8fa4061814712adc4d","observation_id":"efb3440a-3bd6-4259-a9da-86783b700731","resolution":{"observed_at":"2026-08-03T03:04:43.510336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-03T03:04:43.519216Z","title":"one-image-probe-all","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.519216Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:514fc826c1e6fd17bb8af8687ee1c3187311eae030aee919f1e8b1ddf7d416b4","observation_id":"b2969834-4149-4bf7-b511-23fdf39df9e9","resolution":{"observed_at":"2026-08-03T03:04:43.519216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-03T03:04:43.527696Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.527696Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:7aaa7a8906f06e14030aa5b297e8f2ec23c774ba9be0e2056c7e928e0214eb94","observation_id":"82f83726-d85c-4796-ba41-eac1c82bde76","resolution":{"observed_at":"2026-08-03T03:04:43.527696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.10440","last_updated":"2025-07-21T03:53:30Z","snapshot_observed_at":"2026-08-15T17:00:20.282987Z","submitted_at":"2024-11-15T18:58:31Z","title":"LLaVA-CoT: Let Vision Language Models Reason Step-by-Step","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.10440","snapshot_observed_at":"2026-08-03T03:04:43.535274Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.535274Z"},"links":{"cited_paper":"/paper/2411.10440","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:5dda400fe59928fad360497bfbf8f7575b48e5183ec4d54c3feac6366cef0f7b","observation_id":"2949e33f-45e8-4a1c-ace3-7ac62e1dedc4","resolution":{"observed_at":"2026-08-03T03:04:43.535274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11817","last_updated":"2025-02-13T08:11:25Z","snapshot_observed_at":"2026-08-16T19:44:00.811684Z","submitted_at":"2024-01-22T10:26:14Z","title":"Hallucination is Inevitable: An Innate Limitation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11817","snapshot_observed_at":"2026-08-03T03:04:43.547668Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.547668Z"},"links":{"cited_paper":"/paper/2401.11817","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:d8067f7181e66e61c2d8f9fbaab25cea1f0f7ed451ef4d4608543421c0fa2c1b","observation_id":"d7892948-770c-44e4-9336-5b9311cf95af","resolution":{"observed_at":"2026-08-03T03:04:43.547668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:04:43.558943Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.558943Z"},"links":{"citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:0bbc2a5c45e5fc3666a529f2e185ea29f71d727591c3b76af62bb2878f58e9ab","observation_id":"229c6ab5-29ae-415c-a95f-a61cac4ba5f2","resolution":{"observed_at":"2026-08-03T03:04:43.558943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:04:43.567921Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.567921Z"},"links":{"citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:126bf198f5661bdda088bf40d23beb1cbacc86d2aab0de3779fbed6438ee9289","observation_id":"aaba31dd-3c2a-45d3-97fe-36dc67c83545","resolution":{"observed_at":"2026-08-03T03:04:43.567921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.10830","last_updated":"2019-03-26T17:50:34Z","snapshot_observed_at":"2026-08-18T23:02:42.628766Z","submitted_at":"2018-11-27T06:22:26Z","title":"From Recognition to Cognition: Visual Commonsense Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.10830","snapshot_observed_at":"2026-08-03T03:04:43.577749Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.577749Z"},"links":{"cited_paper":"/paper/1811.10830","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:6ac0cd1be1ca488a72fa4ab898cf2309867a9eb5bc5d6c8638dd70fb1307c2d2","observation_id":"4026999d-ba37-4700-acce-8d6ef3a39e7b","resolution":{"observed_at":"2026-08-03T03:04:43.577749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07384","last_updated":"2024-02-12T03:04:42Z","snapshot_observed_at":"2026-08-16T14:19:28.368094Z","submitted_at":"2024-02-12T03:04:42Z","title":"Exploring Perceptual Limitation of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07384","snapshot_observed_at":"2026-08-03T03:04:43.586648Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.586648Z"},"links":{"cited_paper":"/paper/2402.07384","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:2494c2443d48002670c38e135151054368e8e7b177c4a368a714098e1cfa6583","observation_id":"b17d9290-a92b-492e-b60c-2de4e68ccb50","resolution":{"observed_at":"2026-08-03T03:04:43.586648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16198","last_updated":"2024-10-21T17:00:06Z","snapshot_observed_at":"2026-08-16T13:07:19.184083Z","submitted_at":"2024-10-21T17:00:06Z","title":"Improve Vision Language Model Chain-of-thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16198","snapshot_observed_at":"2026-08-03T03:04:43.597192Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.597192Z"},"links":{"cited_paper":"/paper/2410.16198","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:7f221dd6e306201b2f074db8bf3a126fbba1fc39e8006bef775d2f822363ce71","observation_id":"fcc7653f-59bd-4cef-ad4a-f1ac1ad26533","resolution":{"observed_at":"2026-08-03T03:04:43.597192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-19T14:11:01.412437Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-03T03:04:43.606143Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.606143Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:c249bcc12415ddac2b5c77cc6c89efc7a0f6a699bc0b57592f47bf7564e2450e","observation_id":"20a2860e-0ffe-451f-9325-f3d23a3ad043","resolution":{"observed_at":"2026-08-03T03:04:43.606143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T03:04:43.614955Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.614955Z"},"links":{"citing_paper":"/paper/2602.15892"},"observation_digest":"sha256:a17abeca9fa2af3628a333e4bcf1fec3580e53cbce8c2800f2dc5ea67e48a37b","observation_id":"c94359c7-fcee-48cd-b117-4154de4661f1","resolution":{"observed_at":"2026-08-03T03:04:43.614955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.15892","last_updated":"2026-07-14T10:29:12Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T00:01:10.880046Z","submitted_at":"2026-02-10T03:51:00Z","title":"Egocentric Bias in Vision-Language Models"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 5 inbound Pith citation observations for arXiv:2602.15892."}