{"as_of":"2026-08-10T07:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c3cb89de961c9291586a5d0fd901d3ca11724a4365d2474ae9c9edfc861c7b56","coverage":[{"denominator":105,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:12:38.498012Z","state":"measured"},{"denominator":106,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":106,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T10:37:41.277166Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-25T05:46:39.977556Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02095","snapshot_observed_at":"2026-08-04T10:37:41.277166Z","title":"Vlm4d: Towards spatiotemporal awareness in vision language models.arXiv preprint arXiv:2508.02095,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.09606","last_updated":"2026-05-26T09:02:06Z","snapshot_observed_at":"2026-08-08T12:52:25.132885Z","submitted_at":"2025-10-10T17:59:46Z","title":"SpaceVista: All-Scale Visual Spatial Reasoning from mm to km","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T10:37:41.277166Z"},"links":{"cited_paper":"/paper/2508.02095","citing_paper":"/paper/2510.09606"},"observation_digest":"sha256:b4f76d3a2e8c5fc1b5fe26b329c205c546424545b33f1def9c5b9a8478e73961","observation_id":"52903efc-fbc8-49af-b197-4bdc8b134722","resolution":{"observed_at":"2026-08-04T10:37:41.277166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"cited_work":{"arxiv_id":"2508.02095","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.02095","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlm4d: Towards spatiotemporal awareness in vision language models","venue":null,"work_id":"fd121458-5940-4f1f-8f85-380ea73e3a51","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2508.02095","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:fa879205d5ada4f86e15f7b6067f3dd4a2b243b07fda369e6d2de3bb3937d915","observation_id":"b9d7bddd-8785-4d5c-bb5e-1031eda8cec5","resolution":{"observed_at":"2026-05-12T23:01:13.883037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"cited_work":{"arxiv_id":"2508.02095","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.02095","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlm4d: Towards spatiotemporal awareness in vision language models","venue":null,"work_id":"fd121458-5940-4f1f-8f85-380ea73e3a51","year":2025},"citing_paper":{"arxiv_id":"2511.21471","last_updated":"2026-05-07T07:59:46Z","snapshot_observed_at":"2026-08-02T23:27:20.204280Z","submitted_at":"2025-11-26T15:04:18Z","title":"SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition","version":4},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-17T04:54:59.903644Z"},"links":{"cited_paper":"/paper/2508.02095","citing_paper":"/paper/2511.21471"},"observation_digest":"sha256:80cdbdb8042195cf3b219d933674e44f5c623ba4a0c35f527c1f76935495188c","observation_id":"b428e44c-bccd-4e54-903b-c1e3f9ef82b3","resolution":{"observed_at":"2026-05-17T04:59:04.226528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"cited_work":{"arxiv_id":"2508.02095","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.02095","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vlm4d: Towards spatiotemporal awareness in vision language models","venue":null,"work_id":"fd121458-5940-4f1f-8f85-380ea73e3a51","year":2025},"citing_paper":{"arxiv_id":"2605.23045","last_updated":"2026-07-15T09:38:22Z","snapshot_observed_at":"2026-08-02T18:10:47.588058Z","submitted_at":"2026-05-21T21:22:42Z","title":"The TIME Machine: On The Power of Motion for Efficient Perception","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-25T05:40:33.752341Z"},"links":{"cited_paper":"/paper/2508.02095","citing_paper":"/paper/2605.23045"},"observation_digest":"sha256:46c0b27a9002baa2a3260152f382cb54f6498d52977bfd17c59de268b9e6b5f7","observation_id":"261994e6-167f-4bdc-b274-17dfea95c1c4","resolution":{"observed_at":"2026-05-25T05:46:39.980679Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02095","snapshot_observed_at":"2026-07-15T11:06:23.089564Z","title":"Vlm4d: Towards spatiotemporal awareness in vision language models.arXiv preprint arXiv:2508.02095, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.23045","last_updated":"2026-07-15T09:38:22Z","snapshot_observed_at":"2026-08-02T18:10:47.588058Z","submitted_at":"2026-05-21T21:22:42Z","title":"The TIME Machine: On The Power of Motion for Efficient Perception","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-15T11:06:23.089564Z"},"links":{"cited_paper":"/paper/2508.02095","citing_paper":"/paper/2605.23045"},"observation_digest":"sha256:c0627ba9e02ef0c2e982fad023efb0dbeac4bbf869604196f23d2652d49ba693","observation_id":"febf3a8a-1ac7-4b17-b709-d0e8ce2faf8b","resolution":{"observed_at":"2026-07-15T11:06:23.089564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02095","snapshot_observed_at":"2026-08-02T13:27:52.231964Z","title":"Vlm4d: Towards spatiotemporal awareness in vision language models.arXiv preprint arXiv:2508.02095, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.23045","last_updated":"2026-07-15T09:38:22Z","snapshot_observed_at":"2026-08-02T18:10:47.588058Z","submitted_at":"2026-05-21T21:22:42Z","title":"The TIME Machine: On The Power of Motion for Efficient Perception","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T13:27:52.231964Z"},"links":{"cited_paper":"/paper/2508.02095","citing_paper":"/paper/2605.23045"},"observation_digest":"sha256:c1a4ba61fd87083a3b7e873d77cf30b63404cc4433faa6ee1daf5edd0f09e79b","observation_id":"493af086-78f3-47ac-ba1f-8cd2174e622e","resolution":{"observed_at":"2026-08-02T13:27:52.231964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.02095/citation-record","integrity":"/paper/2508.02095/integrity","json":"/paper/2508.02095/citation-record.json","paper":"/paper/2508.02095"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:31.550545Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:31.550545Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:7fe2cf6cdb1de5a2f22ecef94bb83177fe5c505cb6801d4efcaba3b852e22e96","observation_id":"2cd9df5c-473e-46db-9a0e-1eefb1f18b86","resolution":{"observed_at":"2026-08-06T05:12:31.550545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T05:12:31.650096Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:31.650096Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:b3fb68423812e36993b6021302093d36d3af2e00db7c2beea5f1c3ce9aa35a4e","observation_id":"20cf6149-3466-4b5c-bde3-18d813296273","resolution":{"observed_at":"2026-08-06T05:12:31.650096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08905","last_updated":"2024-12-12T03:37:41Z","snapshot_observed_at":"2026-08-05T04:04:21.846023Z","submitted_at":"2024-12-12T03:37:41Z","title":"Phi-4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08905","snapshot_observed_at":"2026-08-06T05:12:31.803287Z","title":"Phi-4 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:31.803287Z"},"links":{"cited_paper":"/paper/2412.08905","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:c19079b1d2492ab11529933164b102d7447e78e85a55b9c1da95622e6da18709","observation_id":"03157756-6f0d-434c-bf3d-df149558d8b7","resolution":{"observed_at":"2026-08-06T05:12:31.803287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:31.926921Z","title":"Phi-4-mini technical report: Compact yet powerful multimodal language models via mixture-of-loras, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:31.926921Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:7396d11e32c26fff772da196be8b627c7c96f53279efb458bb8898fdb655e740","observation_id":"da41d6c2-eb7e-4e3f-be99-4e02b8ae4d9a","resolution":{"observed_at":"2026-08-06T05:12:31.926921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03575","last_updated":"2025-07-09T19:35:31Z","snapshot_observed_at":"2026-08-03T00:21:10.886100Z","submitted_at":"2025-01-07T06:55:50Z","title":"Cosmos World Foundation Model Platform for Physical AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03575","snapshot_observed_at":"2026-08-06T05:12:32.027479Z","title":"Cosmos world foundation model platform for physical ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:32.027479Z"},"links":{"cited_paper":"/paper/2501.03575","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:8124308a0597385def11b0b0b61b1255680e727b8c187d1de39b72b4600bf160","observation_id":"023a61aa-dea6-453f-911a-67a3005c28a2","resolution":{"observed_at":"2026-08-06T05:12:32.027479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-06T05:12:32.127405Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:32.127405Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:6cd674cd240c5df720b99623d716b749828384d41933164f7bd9d03aabb23845","observation_id":"664cab2c-53c6-434f-9e6b-512bfa8ac78f","resolution":{"observed_at":"2026-08-06T05:12:32.127405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:32.246355Z","title":"System card: Claude opus 4 & claude sonnet 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:32.246355Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:4b0e2fab54b2ff113b1690f619742285c2b8dca2d6241aa6048393a36a11eae2","observation_id":"b25dd5a9-5c12-403c-9ed8-387fef226c4f","resolution":{"observed_at":"2026-08-06T05:12:32.246355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T05:12:32.350271Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:32.350271Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:b8eb8344f1058db21a69997070fc9504267e458bdef42e6fb6d6aeb48ad5395a","observation_id":"ef7effab-fbbc-4fee-8e0a-f5b43ec98a7c","resolution":{"observed_at":"2026-08-06T05:12:32.350271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:32.427910Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:32.427910Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:f77ae89cb92d0f8444ee15f28a567431092b6d78c9ffd7d3dde67df23fd7cb5a","observation_id":"fca597d7-1351-4284-8a0d-39b77dc38e1b","resolution":{"observed_at":"2026-08-06T05:12:32.427910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:32.517145Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:32.517145Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:9c124391dac2cf79611d4a4223c61db0b83d90cf5837ff7c1ff558d3a932b86b","observation_id":"0830ce38-d641-4fc2-970c-412f52cebc59","resolution":{"observed_at":"2026-08-06T05:12:32.517145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:32.611205Z","title":"Spatial memory: how egocentric and allocentric combine","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:32.611205Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:4d31f1da51a6ec92dcebb4ebf3383d40a83912b4e2b194fb3247288497acb9d9","observation_id":"73dec874-a00c-4e02-83d3-17cd5c77c48a","resolution":{"observed_at":"2026-08-06T05:12:32.611205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:32.688452Z","title":"On learning mechanical laws of motion from video using neural networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:32.688452Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:ab0e67342d4a6b335ba7420e61d283b6be1516cb97bf47064151ec6901c63457","observation_id":"acb75277-81a3-4e7c-aff8-73480e991858","resolution":{"observed_at":"2026-08-06T05:12:32.688452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:32.764104Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:32.764104Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:279e4c6272e95b3d0ba8d782ed0f6509e2ab97bb6acc531acb4694d68ff4f814","observation_id":"138e8c17-41e3-4474-8df0-a8580409f448","resolution":{"observed_at":"2026-08-06T05:12:32.764104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:32.860941Z","title":"Visualgpt: Data-efficient adaptation of pretrained language models for image captioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:32.860941Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:be82932babedb5f07ea12599f8a07d8049fdbbbb3662c982199f3dea830710a9","observation_id":"d27a6624-6e91-456d-86ac-9850d9b27fb5","resolution":{"observed_at":"2026-08-06T05:12:32.860941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T05:12:32.963176Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:32.963176Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:deebd005505709be5f428dfcb2fe2fe91076c40ae21dd1270c02aa12d1a3d9a8","observation_id":"6af65b91-3c46-4259-b5ff-e5b2e8fdbee5","resolution":{"observed_at":"2026-08-06T05:12:32.963176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-06T05:12:33.079542Z","title":"Sharegpt4video: Improving video understanding and generation with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:33.079542Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:dde257b657e826e0b175163158d6fff283ea0d0c767934f5146d8e02bfb035fd","observation_id":"7255e154-2e35-4724-8474-3cd9e6b63110","resolution":{"observed_at":"2026-08-06T05:12:33.079542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T05:12:33.185606Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:33.185606Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:b1cc4e1fe5bdd92da0ec275452ed41d1a91d2182548aca2c1bc6a90cf1a8799d","observation_id":"e653a79c-4372-4156-9274-87c14bf4e636","resolution":{"observed_at":"2026-08-06T05:12:33.185606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:33.291359Z","title":"Spatialrgpt: Grounded spatial reasoning in vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:33.291359Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:ec646e75016b88706c9a3321d1476aba5c536c2e33b63c34df36ee748212a121","observation_id":"216bba94-d7db-4cb4-8695-c53635ec6aad","resolution":{"observed_at":"2026-08-06T05:12:33.291359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T05:12:33.405270Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:33.405270Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:24fca567f6e16ed7d89441047617620b3fd8f63e47ccfeb6707e9b8f3c09670b","observation_id":"9090c138-07fc-4ccb-b204-1fd92cf0aabe","resolution":{"observed_at":"2026-08-06T05:12:33.405270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:33.493630Z","title":"Sharegpt-4o: Comprehensive multimodal annotations with gpt-4o, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:33.493630Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:6802c6870b89eca2af845c8bb390be6b1d8130587ad5473cf9197dc8ee2462c3","observation_id":"0f4cdeac-312f-41c5-b891-9a6a14f63b6f","resolution":{"observed_at":"2026-08-06T05:12:33.493630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:33.608958Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:33.608958Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:bd87d8a74ea23afcb74a6efb4fabaf8237cb0d2cce6a4c0297161498931b4920","observation_id":"d8a1a71d-81a4-43bc-a62d-bbe78f149e65","resolution":{"observed_at":"2026-08-06T05:12:33.608958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:33.740596Z","title":"Myers, and Anna C","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:33.740596Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:545d4c44710a051173ee487beafc754a243d68c44d78cd2d6015e8f690c489cd","observation_id":"ea616791-2452-45a3-978a-2594d6df6fee","resolution":{"observed_at":"2026-08-06T05:12:33.740596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:33.832680Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:33.832680Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:d311ede7ee2d95769c5c00675c758e07c86163c83ea7d0295cf48130caa96c70","observation_id":"e41f1e65-2363-4bad-ac67-c0680f910318","resolution":{"observed_at":"2026-08-06T05:12:33.832680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:33.911291Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:33.911291Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:61101122bb4bd33f2c8cb4c1046c9cb505ff432467bd145a952f3b25cfab4c31","observation_id":"0dc3a3a9-09a8-4e53-8863-7f09d3716f67","resolution":{"observed_at":"2026-08-06T05:12:33.911291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:34.027237Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:34.027237Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:c04e63a32294eba3aae8570fdef440e47dce96c7135445685835c479eee3085f","observation_id":"378e8e72-bcfb-4c50-ac30-624e52751d48","resolution":{"observed_at":"2026-08-06T05:12:34.027237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06514","last_updated":"2025-04-11T02:36:28Z","snapshot_observed_at":"2026-08-07T16:07:21.231398Z","submitted_at":"2025-04-09T01:25:27Z","title":"Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06514","snapshot_observed_at":"2026-08-06T05:12:34.113371Z","title":"Missing premise exacerbates overthinking: Are reasoning models losing critical thinking skill? arXiv preprint arXiv:2504.06514, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:34.113371Z"},"links":{"cited_paper":"/paper/2504.06514","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:8498a7f9c33d8f64f808879c56e4fc24fa45af6d26cd53d13d476dfeda7fa488","observation_id":"a4be8d57-ab48-46e1-818a-b13203b91d37","resolution":{"observed_at":"2026-08-06T05:12:34.113371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:34.205884Z","title":"Large spatial model: End-to-end unposed images to semantic 3d","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:34.205884Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:17bdf38645c51fc913e8654b37f29363e8106d214ccb14ce858b328fb4b09f8b","observation_id":"92559efe-a876-4d36-977f-ad9c8d05ab43","resolution":{"observed_at":"2026-08-06T05:12:34.205884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20279","last_updated":"2026-04-21T02:48:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:56:30Z","title":"VLM-3R: Vision-Language Models Augmented with Instruction-Aligned 3D Reconstruction","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20279","snapshot_observed_at":"2026-08-06T05:12:34.288256Z","title":"Vlm-3r: Vision-language models augmented with instruction-aligned 3d reconstruction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:34.288256Z"},"links":{"cited_paper":"/paper/2505.20279","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:49a90aae6602f235641c2d7b782c27dfed10ef99bed356727dbda47652b65272","observation_id":"4b5e0ebd-133a-4469-b99f-ee3463fcf341","resolution":{"observed_at":"2026-08-06T05:12:34.288256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:34.373301Z","title":"Freyd and Ronald A","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:34.373301Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:4944edbebf210cec3bbcf943da6926df4f165e3bab87d30fff58d402ec6c316d","observation_id":"6f6d57b7-444e-4382-91a7-24bdb6bbe574","resolution":{"observed_at":"2026-08-06T05:12:34.373301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-06T05:12:34.476769Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:34.476769Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:9ff6617c780c8ae7cd1337fc8ef28f413ceda3debf82fa5d3ef839ee50147cd1","observation_id":"7b6c2ad2-e003-4f25-b766-b51bcd6c89cb","resolution":{"observed_at":"2026-08-06T05:12:34.476769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:34.543530Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:34.543530Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:3731d90a02aa897b342736ec01435e216ca65917a2c6cd045d371a703d1d5cc7","observation_id":"c78cae08-3807-4eea-a7d4-d3b6817c0802","resolution":{"observed_at":"2026-08-06T05:12:34.543530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04790","last_updated":"2023-06-13T13:31:12Z","snapshot_observed_at":"2026-07-06T15:24:38.226044Z","submitted_at":"2023-05-08T15:45:42Z","title":"MultiModal-GPT: A Vision and Language Model for Dialogue with Humans","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04790","snapshot_observed_at":"2026-08-06T05:12:34.629056Z","title":"Multimodal-gpt: A vision and language model for dialogue with humans","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:34.629056Z"},"links":{"cited_paper":"/paper/2305.04790","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:0a71e13ab0681503801c1cae6860512095d038792eb3e74fba881e7987c80591","observation_id":"c873d276-6d9c-4465-aca0-e444a94ae04b","resolution":{"observed_at":"2026-08-06T05:12:34.629056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:34.691518Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:34.691518Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:85de56f31f11151004c27321490846c3af1572bb980cdd3cf6ca6b31c9155225","observation_id":"76488af5-b9c9-4fc5-b18a-ea10b773592d","resolution":{"observed_at":"2026-08-06T05:12:34.691518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08407","last_updated":"2024-07-30T03:15:55Z","snapshot_observed_at":"2026-08-03T12:24:31.311692Z","submitted_at":"2024-06-12T16:54:54Z","title":"MMWorld: Towards Multi-discipline Multi-faceted World Model Evaluation in Videos","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08407","snapshot_observed_at":"2026-08-06T05:12:34.789179Z","title":"Mmworld: Towards multi-discipline multi-faceted world model evaluation in videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:34.789179Z"},"links":{"cited_paper":"/paper/2406.08407","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:671e60a41cc5fd022238705ccc18bc61696036a854d928b5e991a3efa2f02b6f","observation_id":"70c6eb71-8bda-484c-a9a4-72e10f1ef3d5","resolution":{"observed_at":"2026-08-06T05:12:34.789179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.08948","last_updated":"2025-02-05T08:06:37Z","snapshot_observed_at":"2026-07-06T20:05:41.350080Z","submitted_at":"2024-12-12T05:26:43Z","title":"Mojito: Motion Trajectory and Intensity Control for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08948","snapshot_observed_at":"2026-08-06T05:12:34.880167Z","title":"Mojito: Motion trajectory and intensity control for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:34.880167Z"},"links":{"cited_paper":"/paper/2412.08948","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:19897fec4a88202290e815aeaa7fe1c6bbfd911723ed6906b7fb923c53b689f4","observation_id":"768265ba-529a-4ec3-a474-af06077ec43b","resolution":{"observed_at":"2026-08-06T05:12:34.880167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T05:12:34.980532Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:34.980532Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:fa3f72913d3c7960ef7097216c820e8fccef15b020af2833f535f15a151b09f4","observation_id":"47e1ad44-514d-4fd2-acfb-2109865dbaaa","resolution":{"observed_at":"2026-08-06T05:12:34.980532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:35.126549Z","title":"Visual perception of biological motion and a model for its analysis","venue":null,"work_id":null,"year":1973},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:35.126549Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:009de89f3a07ef621fad011329ce07d3ebd2611de8a72318bd397406952e3628","observation_id":"91eb9c84-dedb-47fd-a964-c26841f2dfdd","resolution":{"observed_at":"2026-08-06T05:12:35.126549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03690","last_updated":"2024-05-08T19:46:35Z","snapshot_observed_at":"2026-07-06T18:10:33.673157Z","submitted_at":"2024-05-06T17:59:45Z","title":"How Good is my Video LMM? Complex Video Reasoning and Robustness Evaluation Suite for Video-LMMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03690","snapshot_observed_at":"2026-08-06T05:12:35.219228Z","title":"How good is my video lmm? complex video reasoning and robustness evaluation suite for video-lmms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:35.219228Z"},"links":{"cited_paper":"/paper/2405.03690","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:d71be086ac5c10634257dbf27b4e93eded41a0a75a38e124f8dc6c1f28c34386","observation_id":"3926e618-9310-446e-92b2-7a6c75d3ddf5","resolution":{"observed_at":"2026-08-06T05:12:35.219228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-06T05:12:35.312212Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:35.312212Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:a04ed2eb3a618a1f1938fb1ce3ebbd100cdfa607824c3e499557a7e25981da32","observation_id":"c8aa67fb-5870-41f0-be5b-d5ec4fbcb5f7","resolution":{"observed_at":"2026-08-06T05:12:35.312212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:35.363639Z","title":"Decomposing nerf for editing via feature field distillation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:35.363639Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:14d4f5703e3e1f947c5e508ac0a45d58be483e7fd7a0b5284d8567b5b2f8aefc","observation_id":"f1c06351-8938-4948-8fa7-03c4a5aa02e3","resolution":{"observed_at":"2026-08-06T05:12:35.363639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:35.436299Z","title":"On space-time interest points","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:35.436299Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:b14aab175250531db02f29ded95e694acbf4b616b9136467d4d0ece48793d789","observation_id":"877b0cd2-1373-43a1-a3ba-72745c29571c","resolution":{"observed_at":"2026-08-06T05:12:35.436299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:35.519271Z","title":"Denker, Donnie Henderson, Richard E","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:35.519271Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:f7d696c17c4cf5fd335a684f6f7e7dd22880061d7ba3a4b81384816cab63c876","observation_id":"6ef2fe79-e9c0-42e9-b806-8a54f417adbd","resolution":{"observed_at":"2026-08-06T05:12:35.519271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:35.594550Z","title":null,"venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:35.594550Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:36538a0fe100ae4ecb9f5faffc3d264a01052efd0e13dfff38fcc5d870a17dbc","observation_id":"e19da999-8d1f-4410-81c2-e18f0e18ef1a","resolution":{"observed_at":"2026-08-06T05:12:35.594550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.528963Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":"13777328-e576-42a6-91ed-1568318b1b5e","year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:35.678091Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:48e8eea4397981a1ec5172504b00f30b7a46bb81923753a4dc8abe9aa9691761","observation_id":"431ecfc8-b97f-4732-9738-36b17afad5ce","resolution":{"observed_at":"2026-08-06T05:12:39.533498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T05:12:35.776779Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:35.776779Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:b36f0fc5b08bf26615eebebb11c657d38ef593a08fe79cf5f85b2f333ce28cfd","observation_id":"c4556114-2f60-44f3-887f-a6f9b9ad2e81","resolution":{"observed_at":"2026-08-06T05:12:35.776779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-08-09T05:22:43.395488Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T05:12:35.830990Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:35.830990Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:ed5a9c3bee8ffc317fcfef999c88811b10586d333254c98369b344f388601995","observation_id":"967cacbc-4c71-454c-96d2-8db4b59de9d3","resolution":{"observed_at":"2026-08-06T05:12:35.830990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-06T05:12:35.926537Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:35.926537Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:0ef38842275919bd456d5ff746dacbc5743c91ecc6b4f451eacff08427a39115","observation_id":"90ee9794-d3cf-40dd-a837-5ce11f4ea952","resolution":{"observed_at":"2026-08-06T05:12:35.926537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.517867Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark, 2023 b","venue":null,"work_id":"c2ba0ae2-6246-4218-8513-27c7db585cee","year":2023},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:36.042657Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:04fb17bcf972ad87879cd766ec4889cf91d7dddb77d1b54484965b421ac29451","observation_id":"f45c45fc-5204-4e98-a655-3cf0b5ec2dc3","resolution":{"observed_at":"2026-08-06T05:12:39.521937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.506562Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"012d4ef1-d1ca-4e3e-bc6f-7c5713b28b14","year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:36.146633Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:3a7de3fe0d1c96ec177fc6ab7b9c5488df947a80747f0fd9ef63319b001ed526","observation_id":"0c106f83-17d9-4aa5-a423-d32b6d1a2bdd","resolution":{"observed_at":"2026-08-06T05:12:39.510515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.495490Z","title":"4k4 DG en: Panoramic 4d generation at 4k resolution","venue":null,"work_id":"e49bb848-a4d6-447e-a60c-e5f1573f2b47","year":2025},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:36.253992Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:1b1620687f236d4c9e475a9011baf7ba8db944becd4d95e46f6b720507d59f30","observation_id":"9385a981-cc8d-474b-95bd-8d66dcdb2bd6","resolution":{"observed_at":"2026-08-06T05:12:39.499453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06491","last_updated":"2024-07-09T01:49:08Z","snapshot_observed_at":"2026-07-06T18:43:26.425575Z","submitted_at":"2024-07-09T01:49:08Z","title":"VideoEval: Comprehensive Benchmark Suite for Low-Cost Evaluation of Video Foundation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06491","snapshot_observed_at":"2026-08-06T05:12:36.307349Z","title":"Videoeval: Comprehensive benchmark suite for low-cost evaluation of video foundation model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:36.307349Z"},"links":{"cited_paper":"/paper/2407.06491","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:19b984bbffb3d34b1282bf7a0efe1f41881e925212ddd8b83fb96723b41db28a","observation_id":"018d2dbe-f6e4-4b6e-8b39-75981ee43f78","resolution":{"observed_at":"2026-08-06T05:12:36.307349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-07T15:56:18.164743Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-08-06T05:12:36.368585Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:36.368585Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:980567ffbcf104631c9d9d2abc9a28ac75aa0f37228c16336ca13b9ad2900abe","observation_id":"c0daa79a-4e47-481e-a554-80e5d332ed29","resolution":{"observed_at":"2026-08-06T05:12:36.368585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:36.432646Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:36.432646Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:567ac0c0b53aeefe07baaf98310a1a7af5ce178c1ec00deb07ce79ffc5a5a644","observation_id":"eed4d6db-0496-461b-b66f-3ea999ddd1be","resolution":{"observed_at":"2026-08-06T05:12:36.432646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.477790Z","title":"World model on million-length video and language with ringattention","venue":null,"work_id":"720a9e7e-a9fc-446d-81a4-d5b44e0d625e","year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:36.521405Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:cf8ebc4a383d45fcdc625e48187923f4aeb538dca825ef8d0a0c3a07407fee87","observation_id":"eea025cc-1422-4aa1-9fc7-c6bc4b033163","resolution":{"observed_at":"2026-08-06T05:12:39.481792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-06T05:12:36.616482Z","title":"World model on million-length video and language with blockwise ringattention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:36.616482Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:0461654a5b33c4018945cb770f4184d16fa44b38fc6f3fb08b328ef3ccb0dd92","observation_id":"51dc2eca-82f2-4fda-9721-8dc7dd0f5e69","resolution":{"observed_at":"2026-08-06T05:12:36.616482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.466367Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216--233","venue":null,"work_id":"bdccda24-dd4c-4df6-8985-4836be06784d","year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:36.726798Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:f15c250f07d80ba706455751eb0a343b20858d46861c88e13efbe69464b82de7","observation_id":"916677d5-7baf-4fd4-8920-2e4d2d5c9dfd","resolution":{"observed_at":"2026-08-06T05:12:39.470085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-06T05:12:36.834649Z","title":"Deepseek-vl: towards real-world vision-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:36.834649Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:6f93287a8c59a9ada9e264fcd9167005b5b02f3d45b589e2d5aa15d7a3d52123","observation_id":"c2891cc0-810f-47de-a0ca-3fdf9bde578e","resolution":{"observed_at":"2026-08-06T05:12:36.834649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.454302Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic representations for vision-and-language tasks","venue":null,"work_id":"c7f85e51-c011-4698-b3b5-1d6fe919a37f","year":2019},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:36.958887Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:911729b471590951487b7934f59149e979974297b509150ed2069001d1d75294","observation_id":"ec286d9c-b5c3-4e5f-8d79-9cf591fb5f30","resolution":{"observed_at":"2026-08-06T05:12:39.458973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-06T05:12:37.037955Z","title":"Video-chatgpt: Towards detailed video understanding via large vision and language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:37.037955Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:df389fb16542d1c91ab6b2f1443ca136ae21fc0094276153f68ed1db2642e0eb","observation_id":"0e62240e-473e-426c-a6cb-fcad01a37c68","resolution":{"observed_at":"2026-08-06T05:12:37.037955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.442377Z","title":"Marr and S","venue":null,"work_id":"adc097c8-26c8-4fda-be35-d6193bd22ab4","year":1981},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:37.137351Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:43210d3c411a50e21fbb02311b11a7f98a2c15b641493cd0be44bd19939b7130","observation_id":"be8ee27b-effc-4a6c-a1a1-ab9a57d7f7fd","resolution":{"observed_at":"2026-08-06T05:12:39.446426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.430804Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation","venue":null,"work_id":"3e066378-0dd2-4c92-ae10-0ea5a4b2c860","year":2025},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:37.223152Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:41dedfcf7bda0435b34aa5defda576afea3b00bade2cbc560a8e3c30090eee17","observation_id":"6ea2a558-96e3-45a5-b926-575bde0fd5f7","resolution":{"observed_at":"2026-08-06T05:12:39.434678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16103","last_updated":"2023-11-28T18:16:29Z","snapshot_observed_at":"2026-08-05T15:15:57.768787Z","submitted_at":"2023-11-27T18:59:58Z","title":"Video-Bench: A Comprehensive Benchmark and Toolkit for Evaluating Video-based Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16103","snapshot_observed_at":"2026-08-06T05:12:37.260203Z","title":"Video-bench: A comprehensive benchmark and toolkit for evaluating video-based large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:37.260203Z"},"links":{"cited_paper":"/paper/2311.16103","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:40a2a0e24a6898771224c3e7b1771841cc22b0c601c9fe88cfe33aeeae95fbab","observation_id":"67684500-24fc-4457-a575-c13145b72f96","resolution":{"observed_at":"2026-08-06T05:12:37.260203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.417035Z","title":"Sceneteller: Language-to-3d scene generation","venue":null,"work_id":"3b37321a-0a71-4c3c-8b39-4b5b17f8ec81","year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:37.263896Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:0776c80582bb918f9f8a39a89095e72f75dc14f164df2e39a13bdbae1dea30e9","observation_id":"32b720db-3f87-47e2-b9ef-84a16d44b79a","resolution":{"observed_at":"2026-08-06T05:12:39.421615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.404155Z","title":"Hello gpt-4o","venue":null,"work_id":"9dcc4938-f88d-49ba-8af7-b100515b8685","year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:37.332427Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:b4b10f8c3e529fb0e9ef9a130c32e617df41cf8efae75eb9264f4e72864f6042","observation_id":"00ff1076-2416-46ed-9b02-321ced9abc42","resolution":{"observed_at":"2026-08-06T05:12:39.408122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08643","last_updated":"2025-02-18T16:45:59Z","snapshot_observed_at":"2026-08-09T11:31:44.840528Z","submitted_at":"2025-02-12T18:57:22Z","title":"A Real-to-Sim-to-Real Approach to Robotic Manipulation with VLM-Generated Iterative Keypoint Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08643","snapshot_observed_at":"2026-08-06T05:12:37.457514Z","title":"A real-to-sim-to-real approach to robotic manipulation with vlm-generated iterative keypoint rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:37.457514Z"},"links":{"cited_paper":"/paper/2502.08643","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:e090fbbee00e6231a7bd3de01571b96eb4dffbb0ec187296607fafe4ffb2a817","observation_id":"16a0106c-88aa-4b60-a40b-59df9e41021c","resolution":{"observed_at":"2026-08-06T05:12:37.457514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.390469Z","title":"A benchmark dataset and evaluation methodology for video object segmentation","venue":null,"work_id":"47ae9f98-f1fc-4df2-868f-14f5cc3a583b","year":2016},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:37.521570Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:2540006c7b5703a31605cc8be3505a9464a43809b0da4b01e2d8b307962e2220","observation_id":"cb64b7cd-bf99-476e-b198-b267123171ca","resolution":{"observed_at":"2026-08-06T05:12:39.395023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.00675","last_updated":"2018-03-01T17:50:08Z","snapshot_observed_at":"2026-08-02T10:51:13.194643Z","submitted_at":"2017-04-03T16:44:46Z","title":"The 2017 DAVIS Challenge on Video Object Segmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.00675","snapshot_observed_at":"2026-08-06T05:12:37.630315Z","title":"The 2017 davis challenge on video object segmentation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:37.630315Z"},"links":{"cited_paper":"/paper/1704.00675","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:ad330a428a9e03cc7cd591c75a46cab39cf13635dee675cd07f7cce66e57be77","observation_id":"8fc0dd45-2e18-43e2-b8d8-060dc2ead32d","resolution":{"observed_at":"2026-08-06T05:12:37.630315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:37.734832Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:37.734832Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:3f933091c49b28d3249edf8492a2b825143b59449bc6d2a2bab5961ac22a67e1","observation_id":"1491ac1c-17b6-4d41-80bb-7c8c12409df4","resolution":{"observed_at":"2026-08-06T05:12:37.734832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:37.861862Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:37.861862Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:4856e63ceb894f898776621b42f36708805cac9a8d4539dd28da5d5b4fe9ae52","observation_id":"c5f338b6-8a45-45b4-b407-6057abf106f6","resolution":{"observed_at":"2026-08-06T05:12:37.861862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.363065Z","title":"Learning to localize objects improves spatial reasoning in visual-llms","venue":null,"work_id":"1bb7b5e1-73e1-4bfc-84a1-bfec4f2826b7","year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.012050Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:450132bea2d1c5978acbc415de162b49424a97851bf19a677cc9d16b93b2f202","observation_id":"09c004b0-1cea-4029-9754-68e1f4137c20","resolution":{"observed_at":"2026-08-06T05:12:39.368011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.351295Z","title":"Two-stream convolutional networks for action recognition in videos","venue":null,"work_id":"275ed619-9516-4c2e-a409-8c030f3d0e27","year":2014},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.140748Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:f7608ed291be39dbddf3d1b8bb3a966f2ebc39716b434eec6370fbd0e9f25384","observation_id":"4b53dbe3-ed92-42eb-ae97-181e0f89d6b8","resolution":{"observed_at":"2026-08-06T05:12:39.355662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.339263Z","title":"Spelke and Katherine D","venue":null,"work_id":"89b95e42-37ba-4c8f-af2b-6042485bb0c3","year":2007},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.248287Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:702817a9b03f7ef2d3bb9944e43013d8ee2757fc269dd76d12662807303f7f98","observation_id":"a5d69fda-8888-4ce4-8f7e-f77463128fea","resolution":{"observed_at":"2026-08-06T05:12:39.343276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13807","last_updated":"2024-06-21T09:53:41Z","snapshot_observed_at":"2026-07-06T18:33:54.443005Z","submitted_at":"2024-06-19T20:14:14Z","title":"AlanaVLM: A Multimodal Embodied AI Foundation Model for Egocentric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13807","snapshot_observed_at":"2026-08-06T05:12:38.341363Z","title":"Alanavlm: A multimodal embodied ai foundation model for egocentric video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.341363Z"},"links":{"cited_paper":"/paper/2406.13807","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:6eb6ff47cd6afe34b1d53a8c22b720e46d6f7463654a66f556a786b909d6c26f","observation_id":"ea651a9d-1b27-4bff-8db3-46c22c15aa32","resolution":{"observed_at":"2026-08-06T05:12:38.341363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T05:12:38.401698Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.401698Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:1fea417fc353d41295f6d5ea648a13c25d09636bf7f63feca7657ce32d0f3f07","observation_id":"2a2386b2-d0ec-4ed5-ba0b-9cc7e2f16731","resolution":{"observed_at":"2026-08-06T05:12:38.401698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T05:12:38.411315Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.411315Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:9096b79fbe572a697cd75c02b28f080a2c57abc85b875dda4771c4585a291367","observation_id":"fb9915e8-04f5-4ca1-8b26-eb2b4cee5e84","resolution":{"observed_at":"2026-08-06T05:12:38.411315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-06T05:12:38.419175Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.419175Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:82d08417a61d6fa0427799471c5f4f2dc586acddfddb6cf7eaf36606b11a3a08","observation_id":"9945a242-91fa-48b0-b0ef-6ae9974d16ea","resolution":{"observed_at":"2026-08-06T05:12:38.419175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:38.422740Z","title":"Vlm see, robot do: Human demo video to robot action plan via vision language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.422740Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:89e31e37726d813af5d628c7e57ed375ec4e3c3128ee988e3f871e047269f6ba","observation_id":"464dbc8e-7267-4361-8499-dae2e896ccb3","resolution":{"observed_at":"2026-08-06T05:12:38.422740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.326134Z","title":"Action recognition by dense trajectories","venue":null,"work_id":"ce65cac3-83ce-47e8-8915-117443ffd71e","year":2011},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.426524Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:10ea6d6fb7abd9b208bebf7c12d018a7d09a3a803680280953b32428bdb5dbd6","observation_id":"f8c0ae7d-3c59-4167-ae14-2db5dc8abad1","resolution":{"observed_at":"2026-08-06T05:12:39.331233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-06T05:12:38.429768Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.429768Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:c209bcefcf59754259307024cbc3719d6bfefa51e1ebd11805a81b2eb9737e3c","observation_id":"13f125b0-b270-4d4e-b194-a727aecc27fb","resolution":{"observed_at":"2026-08-06T05:12:38.429768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T05:12:38.433620Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.433620Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:90b95c58647553a9348f41def3eb698dd84c7db0e64beeb8dec6973e28a7a247","observation_id":"018498f3-03d9-4b86-b582-08f36c393dc4","resolution":{"observed_at":"2026-08-06T05:12:38.433620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00622","last_updated":"2025-04-23T04:53:40Z","snapshot_observed_at":"2026-08-07T03:18:26.411414Z","submitted_at":"2024-06-02T05:51:15Z","title":"Compositional 4D Dynamic Scenes Understanding with Physics Priors for Video Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00622","snapshot_observed_at":"2026-08-06T05:12:38.437496Z","title":"Compositional 4d dynamic scenes understanding with physics priors for video question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.437496Z"},"links":{"cited_paper":"/paper/2406.00622","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:9127dfbadb15bbf4826aa980a7485de253b436bbb36fab986df7bbda079a1163","observation_id":"95d03c2e-bec6-456a-905e-5231ad6d9159","resolution":{"observed_at":"2026-08-06T05:12:38.437496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.313888Z","title":"Internvideo2: Scaling foundation models for multimodal video understanding","venue":null,"work_id":"b2c23952-ac60-43ea-a05f-c159b4277521","year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.441640Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:ba3ce7c9ee4f83987191bea38eae1d2c5cf61398453717a8de780d30118568a3","observation_id":"3f667929-c395-473a-ade8-bd8a3d499292","resolution":{"observed_at":"2026-08-06T05:12:39.318380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-06T05:12:38.444811Z","title":"Internvideo2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.444811Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:aa4cb4401ede8c381d050afd5ae58f67cc51a7d6b1c87d4372cfd253841ff32d","observation_id":"0e018751-258d-4358-8242-05dba5a50bca","resolution":{"observed_at":"2026-08-06T05:12:38.444811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-06T05:12:38.448025Z","title":"Finetuned language models are zero-shot learners","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.448025Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:375e1a4861223128d761f03917143a2e6ea2b2536a0295407eebca6eed1aeb88","observation_id":"5650af5a-e4d5-43aa-8037-9f400c9a7c0e","resolution":{"observed_at":"2026-08-06T05:12:38.448025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:38.451316Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.451316Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:53e8409e772664c7ca6c400d64ed0fa12883cfb3a3a359d06befb01de450908b","observation_id":"b63d73dd-d739-4c97-b02d-66b3c0a5b79b","resolution":{"observed_at":"2026-08-06T05:12:38.451316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.294410Z","title":"Cat4d: Create anything in 4d with multi-view video diffusion models","venue":null,"work_id":"a250339f-c574-4d33-b08d-ea8bd3f8decf","year":2025},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.454660Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:03b01932663431fe59f37aecd0d86a1876fd34d15a9cc2dac685c1535026bf6a","observation_id":"45e3e534-fd64-4804-86fc-5ea62873d6f6","resolution":{"observed_at":"2026-08-06T05:12:39.298636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.283404Z","title":"Videollm-mod: Efficient video-language streaming with mixture-of-depths vision computation","venue":null,"work_id":"159557ff-d920-4047-99db-b68596f9c4b2","year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.457594Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:8f69d3ad0c1fc57419a3544c067b65c149492f1d7eb9935316bb9e548df56f25","observation_id":"2e0bbea3-32fc-46ed-97e6-3782efc20926","resolution":{"observed_at":"2026-08-06T05:12:39.286966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.272627Z","title":"Grok-2 beta release","venue":null,"work_id":"2ceb8ff7-397f-43f3-8727-2eb66117543b","year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.460780Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:616de481f8fb50eb85a9e9f377e0287fd2176767d3348a61a3347fb0f22c63df","observation_id":"9c235fba-8e0e-4c66-b221-1238e47e675a","resolution":{"observed_at":"2026-08-06T05:12:39.276520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.261435Z","title":"Youtube-vos: Sequence-to-sequence video object segmentation","venue":null,"work_id":"fac46ec2-6cac-4bdb-bd7e-7332a0348660","year":2018},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.463793Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:e6bb8d62c0f4b995fe10bd2876f0d25b8056f009faf63c93e05bca20c3812fc9","observation_id":"78578b2e-8818-4370-b962-4ba188d86139","resolution":{"observed_at":"2026-08-06T05:12:39.265029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T05:12:38.466933Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.466933Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:3c2f47f00b7cf19ca39b569c8b14143f49358f77262ba3a77efbe64b208c07bb","observation_id":"bed3bb16-6535-4718-8263-7575eca19771","resolution":{"observed_at":"2026-08-06T05:12:38.466933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-06T05:12:38.469833Z","title":"Thinking in space: How multimodal large language models see, remember, and recall spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.469833Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:3d5f2190c0737448dff10c70fc328fe70c7cd14705677c177844b8879c9cf81f","observation_id":"a2b826cd-e5d1-4f83-9b2d-45848f42c01e","resolution":{"observed_at":"2026-08-06T05:12:38.469833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00599","last_updated":"2025-03-25T08:10:15Z","snapshot_observed_at":"2026-08-08T18:38:08.024723Z","submitted_at":"2024-12-31T18:56:46Z","title":"VideoRefer Suite: Advancing Spatial-Temporal Object Understanding with Video LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00599","snapshot_observed_at":"2026-08-06T05:12:38.472814Z","title":"Videorefer suite: Advancing spatial-temporal object understanding with video llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.472814Z"},"links":{"cited_paper":"/paper/2501.00599","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:fc9febdca4aadc0ac3b29250c85b0679cea20d7e1120ea4b2a3d67ebe651a7d0","observation_id":"e178e433-1612-4a94-ab5f-f9e3953d7358","resolution":{"observed_at":"2026-08-06T05:12:38.472814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.251105Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"5ca4df17-60f8-4fad-8bd6-7d7ea4608509","year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.476387Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:70050f942178691c7efb8138a18cd6d2f49a66610c1c1ea478f6976e9a3e8f6d","observation_id":"3778f7a8-6891-4d1a-84fd-f2edad6885a4","resolution":{"observed_at":"2026-08-06T05:12:39.254346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.239702Z","title":"Improving 2d feature representations by 3d-aware fine-tuning","venue":null,"work_id":"482f6250-3064-4dc2-bb57-1e59cad77751","year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.479189Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:e633fced224eae3a591154186fa5264e16faf5654b909cdee887dd35487c1bd2","observation_id":"e68b6a35-fab0-45ca-a137-d16da4d723e5","resolution":{"observed_at":"2026-08-06T05:12:39.243822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-06T05:12:38.481827Z","title":"Videollama 3: Frontier multimodal foundation models for image and video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.481827Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:428b7b59c54b94509890534211e0fbedcb7704c56b8c1966900c5f80db46e732","observation_id":"906c1777-421d-4184-888d-adc06cbdecfd","resolution":{"observed_at":"2026-08-06T05:12:38.481827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-06T05:12:38.485190Z","title":"Video-llama: An instruction-tuned audio-visual language model for video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.485190Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:250ec36a57ad716a18c7a25aa7bb2a578664fd3257f943da19781a945c574eae","observation_id":"e8ab4673-66da-40db-9843-af89c382160e","resolution":{"observed_at":"2026-08-06T05:12:38.485190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10775","last_updated":"2025-04-16T00:50:58Z","snapshot_observed_at":"2026-08-04T08:45:22.395523Z","submitted_at":"2024-04-16T17:59:11Z","title":"COMBO: Compositional World Models for Embodied Multi-Agent Cooperation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10775","snapshot_observed_at":"2026-08-06T05:12:38.488149Z","title":"Combo: compositional world models for embodied multi-agent cooperation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.488149Z"},"links":{"cited_paper":"/paper/2404.10775","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:ee5658671ab6f447a26d2f9493a50eb3a4f51b002addf9d704bad0b43339f4e3","observation_id":"7c9db707-929a-4ec3-9346-a4319d2da646","resolution":{"observed_at":"2026-08-06T05:12:38.488149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.227655Z","title":"Llava-next: A strong zero-shot video understanding model, 2024 b","venue":null,"work_id":"9d7a532c-16a7-4aa8-a4fa-a989126c5f90","year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.491581Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:edf520196e564d018ab0dfd386550202b9148a53bf2329282b436bced2faecfb","observation_id":"ed33a6e8-ec2f-497f-b9c9-448ad37156f5","resolution":{"observed_at":"2026-08-06T05:12:39.231812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12380","last_updated":"2025-01-21T18:56:18Z","snapshot_observed_at":"2026-07-06T20:24:03.105038Z","submitted_at":"2025-01-21T18:56:18Z","title":"MMVU: Measuring Expert-Level Multi-Discipline Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12380","snapshot_observed_at":"2026-08-06T05:12:38.494969Z","title":"Mmvu: Measuring expert-level multi-discipline video understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.494969Z"},"links":{"cited_paper":"/paper/2501.12380","citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:c14396270efcf5f3bfa9a12580ff70bedf7b84582c229d8707444fd66a3b2cb4","observation_id":"bf9ba7c1-8894-43ca-9c45-32e62ae6b963","resolution":{"observed_at":"2026-08-06T05:12:38.494969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:12:39.216900Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":"042b4363-115e-46f8-9d4f-76b785c7eff9","year":2024},"citing_paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-06T05:12:38.498012Z"},"links":{"citing_paper":"/paper/2508.02095"},"observation_digest":"sha256:eb741facb4429bf0f09b87414b9139badd53e3106ad8f8788c62fd8ec9356672","observation_id":"eb72600d-c8fd-4187-b371-bee4d690d62b","resolution":{"observed_at":"2026-08-06T05:12:39.220174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.02095","last_updated":"2025-08-06T19:21:50Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T15:06:09.808299Z","submitted_at":"2025-08-04T06:06:06Z","title":"VLM4D: Towards Spatiotemporal Awareness in Vision Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":75,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":105},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 100 of 105 outbound references and 6 inbound Pith citation observations for arXiv:2508.02095."}