{"as_of":"2026-08-10T02:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4f29510c184bba6f29c30cdf302aa57e96dfb521b042ca551130f93fd4f55c7b","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:59:56.791343Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T13:25:04.053283Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T13:34:40.932917Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"cited_work":{"arxiv_id":"2507.04141","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.04141","snapshot_observed_at":"2026-06-30T13:34:40.932917Z","title":"Pedestrian intention pre- diction via vision-language foundation models,","venue":null,"work_id":"be7f5d26-1f5b-40e6-b15b-394bac2e4b26","year":2025},"citing_paper":{"arxiv_id":"2605.24562","last_updated":"2026-05-23T12:56:44Z","snapshot_observed_at":"2026-08-09T12:45:42.305946Z","submitted_at":"2026-05-23T12:56:44Z","title":"PEDESTRIANQA: A Benchmark for Vision-Language Models on Pedestrian Intention and Trajectory Prediction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T13:25:04.053283Z"},"links":{"cited_paper":"/paper/2507.04141","citing_paper":"/paper/2605.24562"},"observation_digest":"sha256:36450cb0104980643c2321d6bcab19e210bc62a9f2cee08bca5882b27a577e35","observation_id":"0b661ac7-40da-44c8-b177-06d0579874c9","resolution":{"observed_at":"2026-06-30T13:34:40.934373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.04141/citation-record","integrity":"/paper/2507.04141/integrity","json":"/paper/2507.04141/citation-record.json","paper":"/paper/2507.04141"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:53.815180Z","title":"Autonomous vehicles that interact with pedestrians: A survey of theory and practice,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:53.815180Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:b1a323dce897cf6352277adc2a88523fb22c049e4d264ed30d5c5dda64762902","observation_id":"89755a4e-910f-4fd8-b046-ae3d7a248e5b","resolution":{"observed_at":"2026-08-06T19:59:53.815180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:01.265144Z","title":"Pedestrian intention prediction: A convolutional bottom-up multi-task approach,","venue":null,"work_id":"89b4fb24-1752-4a77-a399-5da6c1a7597e","year":2021},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:53.876159Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:2518991a7dd06c39b4f2a20400397b9007eeb51dd190caa0103bcd8d7fdc706e","observation_id":"6cc181ab-3fb6-4ce6-86b4-dfc0be51a1ff","resolution":{"observed_at":"2026-08-06T20:00:01.306110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:01.111349Z","title":"St crossingpose: A spatial- temporal graph convolutional network for skeleton-based pedestrian crossing intention prediction,","venue":null,"work_id":"30e5a72e-d07d-4213-9438-8065a7a835d8","year":2022},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:53.941914Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:9c94700ec81a7b1459562830841efc8612a7247defb12e5f19899ec2383b686c","observation_id":"64c0a2e8-e139-4b94-9995-dd787f946b28","resolution":{"observed_at":"2026-08-06T20:00:01.180728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12810","last_updated":"2025-07-06T19:28:52Z","snapshot_observed_at":"2026-08-08T07:04:05.404266Z","submitted_at":"2024-02-20T08:28:45Z","title":"PIP-Net: Pedestrian Intention Prediction in the Wild","version":3},"cited_work":{"arxiv_id":"2402.12810","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12810","snapshot_observed_at":"2026-08-06T19:59:57.136265Z","title":"PIP-Net: Pedestrian Intention Prediction in the Wild","venue":"cs.CV","work_id":"a7412f0b-d4ce-4a03-a2fa-83789640a32f","year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.015290Z"},"links":{"cited_paper":"/paper/2402.12810","citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:5ffc5ab7fcd6e34ad72bf97867cf96fde0aaa21b08d47470ca72807a122a4736","observation_id":"8a87e33a-a222-4467-b198-55377e59f960","resolution":{"observed_at":"2026-08-06T19:59:57.232162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:01.028501Z","title":"Pedestrian action an- ticipation using contextual feature fusion in stacked rnns,","venue":null,"work_id":"ff96f07c-b9d6-4f97-98fe-e00e2db88609","year":2020},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.088410Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:cf4dbd5a5518b47dc5334733b702dbd363194abfba629db96a8e67b8914e301c","observation_id":"0757d55c-1420-4cf7-b0c6-b743acbad52b","resolution":{"observed_at":"2026-08-06T20:00:01.062175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:00.876828Z","title":"Do they want to cross? understanding pedestrian intention for behavior prediction,","venue":null,"work_id":"a224bc3e-9ade-4e4b-85b8-1d02124f6368","year":2020},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.171753Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:6c3e7e31fbc5f928dc14ceed553a2150174efdc83582db7e3ead3ad7eefb2e9a","observation_id":"1fb433de-cfe6-4c8a-aea3-b8e46effe73e","resolution":{"observed_at":"2026-08-06T20:00:00.945196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:00.695181Z","title":"Multi-modal hybrid architecture for pedestrian action prediction,","venue":null,"work_id":"1cb94507-7993-44dd-b8e4-e7ec48b74480","year":2022},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.251824Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:5a87f991e223f70e07862e089d3222c7bb5a9980d84d232ae94bbd3d6ae08e25","observation_id":"096beed4-6d41-4232-b594-91f5044818fc","resolution":{"observed_at":"2026-08-06T20:00:00.783093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:00.506816Z","title":"Pedestrian graph+: A fast pedestrian crossing prediction model based on graph convo- lutional networks,","venue":null,"work_id":"11ebf8d2-589a-48ee-8fe6-1ad91ddc809c","year":2022},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.354966Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:cb7a9e99183220e66d0dcaa5d27214805b40bc6d715b3be08c4011ae32b5164f","observation_id":"57272dc5-5f20-416e-9830-2ae0172d7b8e","resolution":{"observed_at":"2026-08-06T20:00:00.594842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:00.395261Z","title":"Visual reasoning using graph con- volutional networks for predicting pedestrian crossing intention,","venue":null,"work_id":"ee8188aa-34c3-47f0-99d0-457cb9545511","year":2021},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.433966Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:06605cb786bc38102821e5ca5701979ec240eb7285a3fed4d0dc8baa923a9663","observation_id":"6d431e29-b0a2-484d-924a-97647a9e5bcc","resolution":{"observed_at":"2026-08-06T20:00:00.447152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:00.227431Z","title":"CAPformer: Pedestrian crossing action prediction using transformer,","venue":null,"work_id":"c697439d-7c3c-4ca6-83f2-ae66ecb38bee","year":2021},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.497886Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:223d1b0ecda2b28722a14a73a0ce9d2a031792ef7863f641abeee30822325eac","observation_id":"e4e1f283-16ef-4438-84c3-4698cef4f6e0","resolution":{"observed_at":"2026-08-06T20:00:00.297573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:00:00.031758Z","title":"Pit: Progressive interaction transformer for pedestrian crossing intention prediction,","venue":null,"work_id":"76b826fc-5ecd-44d1-9eb1-27983a77d24d","year":2023},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.565677Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:145debe71180a4e788903f3843720fbb95e6ef1a35a26ab04bf81edb505cbb35","observation_id":"7521fcd7-f346-42b0-82ff-37c9cd83ea1b","resolution":{"observed_at":"2026-08-06T20:00:00.122113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:59.866575Z","title":"Predicting pedestrian inten- tions with multimodal intentformer: A co-learning approach,","venue":null,"work_id":"c951a898-3b5b-4ad6-b55e-e5a5f4e47204","year":2025},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.646030Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:8576a4703ea849cee434e6b78d3a5d4438bc563997f59cef4f7c17f2bb976001","observation_id":"841f712e-7dfd-4388-9ebb-c567f59da6c3","resolution":{"observed_at":"2026-08-06T19:59:59.936485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:59.709143Z","title":"Pedestrian behavior inter- pretation from pose estimation,","venue":null,"work_id":"588070c6-bcae-467a-a818-e7f0025cd6e5","year":2021},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.713024Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:6887f6c0b280e6eea70efe35da2d9aaaf9d0488972ac923c28d691af78be29c5","observation_id":"cbc0cc2c-ff16-477a-aa65-247a29a4ad34","resolution":{"observed_at":"2026-08-06T19:59:59.789304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:59.518073Z","title":"Multi-scale pedestrian intent prediction using 3d joint information as spatio-temporal representation,","venue":null,"work_id":"53754ea5-0c44-4fd5-b59a-012c87f891bc","year":2023},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.773984Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:71b9222c50d1c50536652ffacb160fef2989412b3b7463fe8864290b7343d130","observation_id":"e7e25164-28e8-4cf8-9723-5db6a1c92a99","resolution":{"observed_at":"2026-08-06T19:59:59.600266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:54.861620Z","title":"Spatiotemporal relationship reasoning for pedestrian intent prediction,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.861620Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:8c959ea04168ce27d949a1ab52d325d6781dbee6dfe684d82e9f010452b7b0f1","observation_id":"d72d0405-b7da-412a-ab62-1046703f990a","resolution":{"observed_at":"2026-08-06T19:59:54.861620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:59.329499Z","title":"Real-time intent prediction of pedestrians for autonomous ground vehicles via spatio-temporal densenet,","venue":null,"work_id":"951990a9-a7cf-488a-a5b1-4e65199524c8","year":2019},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.933786Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:d39ddaf55d7b6cd3c15b07a7aab374bcfc1b64d3920eb62b3cec39ec4f179e55","observation_id":"42de927b-2ff4-4089-ad57-1ffa7ba398ac","resolution":{"observed_at":"2026-08-06T19:59:59.442338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:59.147571Z","title":"Pedestrian-vehicle information modulation for pedestrian crossing intention prediction,","venue":null,"work_id":"86f71d22-fcaf-4200-9058-ab26f80e3ea7","year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:54.998685Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:d92b158077112da9670526dcae0308cc213e0090694a4571b11d1117054cb29c","observation_id":"aa461dfd-b696-4dcc-9b73-896c835a4f53","resolution":{"observed_at":"2026-08-06T19:59:59.265412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:58.999779Z","title":"Causal reasoning in typical computer vision tasks,","venue":null,"work_id":"e42ddec4-024a-4ceb-9542-14a8a46c9f86","year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.083231Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:2ff416d3508ec50439c7c87d6c89d68ba2a0009aed69f2c7860c5cdeab410904","observation_id":"615b7547-8719-485d-bfb7-e2ac534abdcf","resolution":{"observed_at":"2026-08-06T19:59:59.071147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:58.853436Z","title":"Vision language models in autonomous driving: A survey and outlook,","venue":null,"work_id":"e4bbb266-60f9-4b1c-add4-d834e9c11e7f","year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.171703Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:0748df506dabcec9d95c79df9daa53cddd366a6620c317bf953e3fd3bb6a21d2","observation_id":"18069a05-b99a-4246-9453-288c0dc92147","resolution":{"observed_at":"2026-08-06T19:59:58.920039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:58.676090Z","title":"Gpt-4v takes the wheel: Promises and challenges for pedestrian behavior prediction,","venue":null,"work_id":"f02683b0-91c2-4d49-8765-bf4726c9cb1a","year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.267162Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:84f07f52b5286ad9ad70146e22c41a5bea6917e8dc997a3d6ba87944888365b8","observation_id":"35d3e16b-b52f-4d17-b32c-0190c0006e9a","resolution":{"observed_at":"2026-08-06T19:59:58.761794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:58.498788Z","title":"Omnipredict: Gpt-4o enhanced multi-modal pedestrian crossing intention prediction","venue":null,"work_id":"ca895340-c965-4c40-b6de-4bc737302aae","year":null},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.367452Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:789eb919fe673325c5ab54778820afad0e696f9467751f815cfdf2c6edade323","observation_id":"ef2988a4-73fc-4e49-8be5-1a12e03fc931","resolution":{"observed_at":"2026-08-06T19:59:58.575555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:58.299614Z","title":"Pedvlm: Pedestrian vision language model for intentions prediction,","venue":null,"work_id":"f960c803-0ff1-40c6-a4df-a69fb74397f9","year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.459977Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:aeaa087b6704daa56dc0b7349f4e88561f278f0851242efdcf5dc084050330f3","observation_id":"a05142d2-747f-4bde-8387-19af28ae0283","resolution":{"observed_at":"2026-08-06T19:59:58.398927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:58.125645Z","title":"Cross or wait? predicting pedestrian interaction outcomes at unsignalized crossings,","venue":null,"work_id":"9492d69f-3391-4795-91c9-44b08482e3e4","year":2023},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.569120Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:ff52eed9c493823f4621d34e1a0388c154f843d84da29aaffd7100efa0b79911","observation_id":"bf34fca6-b13d-4b6f-8afd-f1890ef41e1f","resolution":{"observed_at":"2026-08-06T19:59:58.222821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.07645","last_updated":"2024-09-11T22:13:01Z","snapshot_observed_at":"2026-08-02T23:13:15.299065Z","submitted_at":"2024-09-11T22:13:01Z","title":"Feature Importance in Pedestrian Intention Prediction: A Context-Aware Review","version":1},"cited_work":{"arxiv_id":"2409.07645","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.07645","snapshot_observed_at":"2026-08-06T19:59:56.995785Z","title":"Feature Importance in Pedestrian Intention Prediction: A Context-Aware Review","venue":"cs.CV","work_id":"329228d6-d219-42c5-8187-a61b559cdc58","year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.663331Z"},"links":{"cited_paper":"/paper/2409.07645","citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:00433996053d45f092bc1e2ff52c370a11d06d85b70f22cbb8da6a210b561816","observation_id":"5fdb116b-8981-422a-8255-343c2ee44d16","resolution":{"observed_at":"2026-08-06T19:59:57.055566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12644","last_updated":"2025-07-21T01:47:18Z","snapshot_observed_at":"2026-08-09T19:48:59.984640Z","submitted_at":"2024-06-18T14:12:27Z","title":"Hierarchical Prompting Taxonomy: A Universal Evaluation Framework for Large Language Models Aligned with Human Cognitive Principles","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12644","snapshot_observed_at":"2026-08-06T19:59:55.734120Z","title":"Hierarchical prompting taxonomy: A universal evaluation framework for large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.734120Z"},"links":{"cited_paper":"/paper/2406.12644","citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:b053fda79077411ac77940cdb9af664a48544d8a52e300efff5822b830a6bd6c","observation_id":"ca7ff6da-26b8-4be8-b4bd-6873e3b2a77b","resolution":{"observed_at":"2026-08-06T19:59:55.734120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01910","last_updated":"2023-03-10T17:20:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-03T15:43:03Z","title":"Large Language Models Are Human-Level Prompt Engineers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01910","snapshot_observed_at":"2026-08-06T19:59:55.815565Z","title":"Large language models are human-level prompt engineers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.815565Z"},"links":{"cited_paper":"/paper/2211.01910","citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:448eea504ec7df04175d32e054fa752ab7824748f609a88a5cd6248a272dace9","observation_id":"fc62114f-4913-4812-9b21-2bc71f52489a","resolution":{"observed_at":"2026-08-06T19:59:55.815565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:57.958074Z","title":"Benchmark for evaluating pedestrian action prediction,","venue":null,"work_id":"936936b9-a4ee-4128-9f63-8c36734a0844","year":2021},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.901830Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:06391ba86668fbba00aeb1e64944f817285d93547b1657d4a7ee5b094468ac4c","observation_id":"9ceed48e-7f92-4f3b-9b9f-8c3bd66adac8","resolution":{"observed_at":"2026-08-06T19:59:58.017275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07702","last_updated":"2024-03-14T02:07:11Z","snapshot_observed_at":"2026-08-02T18:42:43.546865Z","submitted_at":"2023-08-15T11:08:30Z","title":"Better Zero-Shot Reasoning with Role-Play Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07702","snapshot_observed_at":"2026-08-06T19:59:55.992136Z","title":"Better zero-shot reasoning with role-play prompting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:55.992136Z"},"links":{"cited_paper":"/paper/2308.07702","citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:3092d9bdd21eef25d9687da58496c1933ff2425fcc12a18beb964112b292123f","observation_id":"99d7b5b0-b85f-469a-8584-a08fa55707f7","resolution":{"observed_at":"2026-08-06T19:59:55.992136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17600","last_updated":"2024-01-31T04:57:12Z","snapshot_observed_at":"2026-07-06T17:22:53.623679Z","submitted_at":"2024-01-31T04:57:12Z","title":"Good at captioning, bad at counting: Benchmarking GPT-4V on Earth observation data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17600","snapshot_observed_at":"2026-08-06T19:59:56.092349Z","title":"Good at captioning, bad at counting: Benchmarking gpt-4v on earth observation data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:56.092349Z"},"links":{"cited_paper":"/paper/2401.17600","citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:9f40b89275ed4ad449a7c8683866d0af5e5ae88f8c8ba64b91d2bcdf244bdcb2","observation_id":"699aaa9e-581e-4a0c-afd9-1752e25544cb","resolution":{"observed_at":"2026-08-06T19:59:56.092349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:57.808945Z","title":"Is the pedestrian going to cross? answering by 2d pose estimation,","venue":null,"work_id":"1429fe87-55b8-432f-8899-b7d96b7efd5d","year":2018},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:56.186360Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:d9ac3c1b717d9d0db50b9c2a40b7b5104a33264230ad10fe2f7bf41c06502e96","observation_id":"1cd8d6af-bea9-49c0-8646-1cf809825b86","resolution":{"observed_at":"2026-08-06T19:59:57.884083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:57.649334Z","title":"Chatgpt: Generative pre-trained transformer,","venue":null,"work_id":"09dd32e4-80e0-4e1c-b668-c011e59e9a38","year":2023},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:56.286479Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:d8e89a6caca55e98bff7165fde033c5de3e9f143f1e383e62649bc4d6596ab02","observation_id":"4e747a18-0a1f-454e-8ab8-2bf16ea658da","resolution":{"observed_at":"2026-08-06T19:59:57.715335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:57.526641Z","title":"Agreeing to cross: How drivers and pedestrians communicate,","venue":null,"work_id":"53707847-60f7-4cea-af48-287a4ecbcdc4","year":2017},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:56.376470Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:5bc6d6eae828c537edf4858168c2d94d99c298132790268255c8a82f7670cb9e","observation_id":"35420cca-34d7-4473-94d1-ff1a8173274b","resolution":{"observed_at":"2026-08-06T19:59:57.594088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:59:57.335630Z","title":"PIE: A large-scale dataset and models for pedestrian intention estimation and trajectory prediction,","venue":null,"work_id":"ba26ab65-147b-4c0c-9f60-6c663c28d8fd","year":2019},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:56.479906Z"},"links":{"citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:4b8f9f5ceb4a6937dd8890950e9495387c4f12e33e946efa160e8d97e021ef5e","observation_id":"c5cf1eb8-ead7-4137-abbd-bfce2e73541e","resolution":{"observed_at":"2026-08-06T19:59:57.417787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T19:59:56.585090Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:56.585090Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:000ace21f669d90fd4f5d71066a2478dfcb6d61b28667312003c63a490a09759","observation_id":"398caa99-291c-4851-bb0a-8b63ce9b5728","resolution":{"observed_at":"2026-08-06T19:59:56.585090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-06T19:59:56.685176Z","title":"Minigpt-4: En- hancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:56.685176Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:b26793a7e22997c7bba885a7257f07372eaa5016e7c6466cf3b744ac4b5a894a","observation_id":"768bfb91-1616-4cd3-82f5-8b553a37cf52","resolution":{"observed_at":"2026-08-06T19:59:56.685176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-07-06T18:44:24.873040Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-06T19:59:56.791343Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:59:56.791343Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2507.04141"},"observation_digest":"sha256:df0952454dbe5774a331fc37bcb27f03bbfc52d93ffc2375b1264392e4255d7e","observation_id":"f989038e-d8a4-4f79-a1a3-12bf90ba02b3","resolution":{"observed_at":"2026-08-06T19:59:56.791343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.04141","last_updated":"2025-07-05T19:39:00Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T19:06:12.754824Z","submitted_at":"2025-07-05T19:39:00Z","title":"Pedestrian Intention Prediction via Vision-Language Foundation Models"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":25},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 1 inbound Pith citation observation for arXiv:2507.04141."}