{"as_of":"2026-08-14T11:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4cbb05ad52d935ae9936d81749c3fcef4930aa187b597f1cdb9b1c2c4ce8c7d4","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:49:10.881232Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T08:43:33.391528Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20566","snapshot_observed_at":"2026-07-14T04:42:38.419346Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11570","last_updated":"2026-07-13T13:50:43Z","snapshot_observed_at":"2026-08-14T08:13:54.037192Z","submitted_at":"2026-07-13T13:50:43Z","title":"ERR@HRI 3.0 Challenge: Multimodal Detection of Errors and Anticipation in Human-Robot Interactions","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T04:42:38.419346Z"},"links":{"cited_paper":"/paper/2506.20566","citing_paper":"/paper/2607.11570"},"observation_digest":"sha256:37c86f60974deee07a7002ac043a0d94460d8ebc20e6db7854faf6fb6d0c4a7a","observation_id":"e94ac13b-5b75-40fb-92fe-c1c5ee6012dc","resolution":{"observed_at":"2026-07-14T04:42:38.419346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20566","snapshot_observed_at":"2026-08-02T08:43:33.391528Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13056","last_updated":"2026-07-05T09:15:35Z","snapshot_observed_at":"2026-08-09T18:22:23.663141Z","submitted_at":"2026-07-05T09:15:35Z","title":"HRIBench: Benchmarking Interaction-Centric Human-Robot Collaboration","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T08:43:33.391528Z"},"links":{"cited_paper":"/paper/2506.20566","citing_paper":"/paper/2607.13056"},"observation_digest":"sha256:9a43318dd018c8a064c9e25737627126d1c05240ef212a4a801d49c4843da045","observation_id":"f3cf56be-7b34-4131-812e-7362bbde9172","resolution":{"observed_at":"2026-08-02T08:43:33.391528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.20566/citation-record","integrity":"/paper/2506.20566/integrity","json":"/paper/2506.20566/citation-record.json","paper":"/paper/2506.20566"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.18711","last_updated":"2025-05-16T16:46:31Z","snapshot_observed_at":"2026-08-12T10:55:09.629808Z","submitted_at":"2024-11-27T19:32:03Z","title":"Evaluating Vision-Language Models as Evaluators in Path Planning","version":4},"cited_work":{"arxiv_id":"2411.18711","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18711","snapshot_observed_at":"2026-08-06T22:49:11.112158Z","title":"Evaluating Vision-Language Models as Evaluators in Path Planning","venue":"cs.CV","work_id":"cbf459c7-3d02-47fb-9dfc-3bea72a3c591","year":2024},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:07.509682Z"},"links":{"cited_paper":"/paper/2411.18711","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:49823635d41c6c2ca8d258e0419bf522ace0c4b4b166291d08ec2918d254582d","observation_id":"1a90adff-d994-4835-914a-c1ef00a2389d","resolution":{"observed_at":"2026-08-06T22:49:11.200446Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:16.914770Z","title":"In: Proceedings of the 19th ACM International Conference on Mul- timodal Interaction, pp","venue":null,"work_id":"16aac432-1dec-41b5-bb9a-264cde989105","year":2017},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:07.590463Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:552c159674ea4c4e8a792086152d4f730762dfb6f36de21f3849341f805ac989","observation_id":"962eeeb6-509b-491b-a217-70702f5a12f5","resolution":{"observed_at":"2026-08-06T22:49:17.057335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15517","last_updated":"2025-06-18T21:24:31Z","snapshot_observed_at":"2026-08-14T02:10:06.126777Z","submitted_at":"2025-05-21T13:42:52Z","title":"Robo2VLM: Visual Question Answering from Large-Scale In-the-Wild Robot Manipulation Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15517","snapshot_observed_at":"2026-08-06T22:49:07.721472Z","title":"arXiv preprint arXiv:2505.15517 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:07.721472Z"},"links":{"cited_paper":"/paper/2505.15517","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:d725399c32519db1421f4b0cd8da03248d7827cebbcae197c5bcdc1a5cd99daf","observation_id":"71e0cde9-4a6e-48b7-bf08-c46222e1b4e5","resolution":{"observed_at":"2026-08-06T22:49:07.721472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:16.685189Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"3142740a-a504-4c68-9580-dbef2f9b1f9d","year":2024},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:07.813078Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:2465adfcbe26deb1da0877acf627e052d6c042ba15e4261c4adcc7dde53fd235","observation_id":"6138fe75-e541-450c-a7b0-2affee204481","resolution":{"observed_at":"2026-08-06T22:49:16.795102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:16.325183Z","title":"In: International Conference on Learning Representations (ICLR) (2025)","venue":null,"work_id":"8c5dce68-fcec-4dd4-9f62-4bac84696780","year":2025},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:07.915292Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:92bdb59e1dda818e6029576f3f41252df5860c91a16f4949d77c85f9e52df586","observation_id":"a50c31f4-58d4-4301-bb48-80366c6c1157","resolution":{"observed_at":"2026-08-06T22:49:16.485703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:16.046998Z","title":"In: 2008 8th Ieee International Conference on Automatic Face & Gesture Recognition, pp","venue":null,"work_id":"888e660c-6ca5-4b1a-9649-b9675c476b4c","year":2008},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:08.077537Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:ae3861d338ede29621fb4095ba08e5b4a5bd15593eee0c9006ba97e5ecc2653d","observation_id":"500ca7e8-8220-4aff-b648-776631922f9f","resolution":{"observed_at":"2026-08-06T22:49:16.193859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T22:49:08.200579Z","title":"arXiv preprint arXiv:2312.11805 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:08.200579Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:855d89c804c8dd8c5a66aa803a7c2006c9a1da446618b7abf2bac9a5efe960d3","observation_id":"43fee879-e3ea-4fe5-9578-b03d930b3efa","resolution":{"observed_at":"2026-08-06T22:49:08.200579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:49:08.371492Z","title":"arXiv preprint arXiv:2407.21783 (2024) HRIBench 9","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:08.371492Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:7bc72cfc21fdb0f36e34c8e0aa5dbd43e305bbdac55d32cddba6e81f364fd605","observation_id":"04f16770-e207-4dac-b03e-0b76b6c81956","resolution":{"observed_at":"2026-08-06T22:49:08.371492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:15.665994Z","title":"In: Neural Information Processing Systems (NeurIPS) (2018)","venue":null,"work_id":"e401e217-89a7-47be-a6e1-c6a119da4048","year":2018},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:08.475881Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:5fd52edf07effd3bac840c6602c1f63c73ae5261b4709a51c07f30b9a78ab67b","observation_id":"7cfc5b71-6772-4b10-abd6-4f8f340cb62e","resolution":{"observed_at":"2026-08-06T22:49:15.866164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05821","last_updated":"2024-12-08T06:54:43Z","snapshot_observed_at":"2026-08-12T22:08:01.135104Z","submitted_at":"2024-11-04T18:01:34Z","title":"Benchmarking Vision, Language, & Action Models on Robotic Learning Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05821","snapshot_observed_at":"2026-08-06T22:49:08.555776Z","title":"arXiv preprint arXiv:2411.05821 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:08.555776Z"},"links":{"cited_paper":"/paper/2411.05821","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:24f429830b71436a9799f586eed3a81df7a17cf18515181fa05542a0d881dfd7","observation_id":"84759529-e6ae-4686-a506-72c9db046e09","resolution":{"observed_at":"2026-08-06T22:49:08.555776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:15.319166Z","title":"Human factors53(5), 517–527 (2011)","venue":null,"work_id":"6e8dc0fd-195c-4468-b372-387b33b81c9a","year":2011},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:08.658326Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:eb8d1b30c84613e4b331bdfcd32a4989df41cfb1fbe92d3ef034581f1dea61ab","observation_id":"eaf7af65-57fd-49c9-b145-d09867dd3e2f","resolution":{"observed_at":"2026-08-06T22:49:15.496895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-06T22:49:08.758255Z","title":"arXiv preprint arXiv:2504.16054 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:08.758255Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:7045ecdd54437de1a243f9c4800feb8ba0a0de6f392e0d741bba81d98e9ea1a4","observation_id":"59c4f372-2edd-4317-aaea-6ba8c91afd8c","resolution":{"observed_at":"2026-08-06T22:49:08.758255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:14.962788Z","title":"In: Conference on Robot Learning (2023)","venue":null,"work_id":"2aff181d-7ec3-4737-a309-672d5eb273e4","year":2023},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:08.876306Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:ca1d58a4f4dbe1cb1d5b18dcc4054aaf849833fbfe58e0dba8fe042c24f6d125","observation_id":"3440f35e-8fb1-4ba9-9e23-b74c19f90f4d","resolution":{"observed_at":"2026-08-06T22:49:15.105483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:14.600699Z","title":"Discourse Processes52(4), 255–289 (2015)","venue":null,"work_id":"f6bfc09f-bacb-43f0-af8e-25ede9544d3b","year":2015},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:08.993107Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:1ce51f4bb41fe51065f4bf855314650c8cc9dbd27bc6f7774a135f245ed5e83c","observation_id":"85b25a58-aa63-465c-9dac-fc4084039e6b","resolution":{"observed_at":"2026-08-06T22:49:14.752505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02189","last_updated":"2025-04-06T03:12:51Z","snapshot_observed_at":"2026-08-13T18:28:46.913210Z","submitted_at":"2025-01-04T04:59:33Z","title":"A Survey of State of the Art Large Vision Language Models: Alignment, Benchmark, Evaluations and Challenges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02189","snapshot_observed_at":"2026-08-06T22:49:09.088375Z","title":"arXiv preprint arXiv:2501.02189 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:09.088375Z"},"links":{"cited_paper":"/paper/2501.02189","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:b0400ce31619b66f27d2e106959c8767fc393213492dadc7d9b1c8e242a759cd","observation_id":"2a620a9f-dda5-4e84-9be3-0afa2b7e443a","resolution":{"observed_at":"2026-08-06T22:49:09.088375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:14.217180Z","title":"In: Robotics: Science and Systems (RSS) (2024)","venue":null,"work_id":"c5838c6e-ef44-4a85-827d-960913f33d69","year":2024},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:09.199127Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:8f9ce77641372ca1a14a82e89b6ea8e5cc4cb47c5cca58d1ebabeb96428b5378","observation_id":"f7deb7e5-620d-4d07-afaa-baa9253c1041","resolution":{"observed_at":"2026-08-06T22:49:14.371159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:13.921531Z","title":"ACM Transactions on Human-Robot Interaction12(3), 1–39 (2023)","venue":null,"work_id":"719698d1-d22d-4b02-ae57-1773353dc2ff","year":2023},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:09.350710Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:c4765a62c02dae44bd9be5c82bb0518a14f482f0326fd566fc6e646488156c71","observation_id":"771afcae-c807-47e1-bc8d-dfd15e5b7eca","resolution":{"observed_at":"2026-08-06T22:49:14.066289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:13.571223Z","title":"https://robotsguide.com/robots/kuri (n.d.)","venue":null,"work_id":"6681f0e5-15ae-4c2b-b7ce-0553d5a643ed","year":2025},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:09.505490Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:fb7c962707e23b85647274f7c1cd67b1a9028afec492d20e9a693dd77ac7d1d0","observation_id":"f17af41b-8e60-4a27-bc26-6d2157040c84","resolution":{"observed_at":"2026-08-06T22:49:13.769324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:13.135105Z","title":"In: 2023 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), pp","venue":null,"work_id":"8f1af75d-c670-492a-978a-629234b4951b","year":2023},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:09.666785Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:7c457c674cda8040d6af6fc2bcddbac9530007df2638a519f415f27cb7b245fe","observation_id":"c8b0254b-7d9e-4bb3-8206-9beb73ad23f3","resolution":{"observed_at":"2026-08-06T22:49:13.346604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:12.830648Z","title":"Image and Vision Computing25(12), 1875–1884 (2007)","venue":null,"work_id":"3c08f763-55f0-4d66-be63-7158f6df9498","year":2007},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:09.869220Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:38109708d26c4d56327f913b8de7ba3009219f51a74627e3429356580bc81797","observation_id":"7fc6ee28-5da2-48ca-b3e4-943eb4eaed6d","resolution":{"observed_at":"2026-08-06T22:49:12.972703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T22:49:10.058113Z","title":"arXiv preprint arXiv:2410.21276 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:10.058113Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:595747eee1d92303309e4f7e0965326388421b10603d17ba89d463da03553166","observation_id":"da941580-0f76-4fb9-a786-311d074a0bac","resolution":{"observed_at":"2026-08-06T22:49:10.058113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:12.542182Z","title":"ACM Transactions on Human-Robot Interaction12(1), 1–66 (2023)","venue":null,"work_id":"572d4b9b-9a8c-4c75-9b43-dd87471ce4b8","year":2023},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:10.170501Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:a2b02bbc9989cbb6f76a1e822bdb2393b534c112a9b54962b705fba2d9369b90","observation_id":"e9872746-cccb-424c-8a30-bae22d03fa1b","resolution":{"observed_at":"2026-08-06T22:49:12.673737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:12.236295Z","title":"IEEE Transactions on Robotics38(3), 1755–1772 (2021)","venue":null,"work_id":"39cf9747-ec30-4fc5-b13d-b82f21a2ee8e","year":2021},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:10.326554Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:f0cc42f960e4000b8384ede282d325f6e89eb39dabf82d4c3d80711c361793d7","observation_id":"ac043cf2-4523-4df1-a8a3-7a424b53de3f","resolution":{"observed_at":"2026-08-06T22:49:12.374698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:11.934322Z","title":"ACM Transactions on Human-Robot Interaction 12(2), 1–21 (2023)","venue":null,"work_id":"ddc3a470-208c-47de-9a0c-ba8c01b274ff","year":2023},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:10.477606Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:6f941ea7b0e112ed30639b0963e7b16da21dc911f240b374953f06ce80c6221d","observation_id":"d24db9c4-7666-4fdf-9c03-eba2412b1b6d","resolution":{"observed_at":"2026-08-06T22:49:12.095926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:11.627912Z","title":"Advances in Neural Information Processing Systems35, 12,014–12,026 (2022) 10 Zhonghao Shi et al","venue":null,"work_id":"3e7b0843-3e05-4ef8-ad89-3863bd0305ef","year":2022},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:10.621525Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:e188f14cf23903dbcb6db1be215e342a3b8e194dc6f678d6f1a144eea602903e","observation_id":"e218a7f9-66ac-44ac-9c42-c00fa81747a2","resolution":{"observed_at":"2026-08-06T22:49:11.776077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09698","last_updated":"2025-08-30T18:59:30Z","snapshot_observed_at":"2026-08-13T06:40:08.598779Z","submitted_at":"2025-05-14T18:01:00Z","title":"ManipBench: Benchmarking Vision-Language Models for Low-Level Robot Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09698","snapshot_observed_at":"2026-08-06T22:49:10.769599Z","title":"arXiv preprint arXiv:2505.09698 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:10.769599Z"},"links":{"cited_paper":"/paper/2505.09698","citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:f96c8315363c7069a7b29d44ca5f94d912b68ab03ea683176e50c3b89b51f3b6","observation_id":"f2ad57d4-4681-4293-8b70-f9451405badc","resolution":{"observed_at":"2026-08-06T22:49:10.769599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:49:11.336047Z","title":"In: Artificial In- telligence and Machine Learning in Defense Applications II (2020)","venue":null,"work_id":"554f09ba-68ad-4be1-a15b-bf3433da1127","year":2020},"citing_paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:49:10.881232Z"},"links":{"citing_paper":"/paper/2506.20566"},"observation_digest":"sha256:7871c32bbe2eaa83c01214c9492e3cf92a67b0eb0738c206bf9f88ffa330d382","observation_id":"d6210fe0-1cc8-4a6a-9776-53739c97e593","resolution":{"observed_at":"2026-08-06T22:49:11.460335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.20566","last_updated":"2025-06-25T16:01:38Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-13T18:37:41.249105Z","submitted_at":"2025-06-25T16:01:38Z","title":"HRIBench: Benchmarking Vision-Language Models for Real-Time Human Perception in Human-Robot Interaction"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 2 inbound Pith citation observations for arXiv:2506.20566."}