{"as_of":"2026-08-18T04:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f223a84337d5bbcb907d9e70c345101d8ffd272d7705ecccbf539f472cd19470","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:53:52.775348Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T03:13:07.963343Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T03:14:31.636817Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"cited_work":{"arxiv_id":"2604.10506","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.10506","snapshot_observed_at":"2026-07-08T03:14:31.636817Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","venue":"cs.AI","work_id":"07a49f23-eba6-4cf1-adad-fa126e89df34","year":2026},"citing_paper":{"arxiv_id":"2607.06522","last_updated":"2026-07-07T17:27:59Z","snapshot_observed_at":"2026-08-15T08:05:47.608523Z","submitted_at":"2026-07-07T17:27:59Z","title":"Bridging Physical Reasoning and Task Generalization via Visual Action Outcome Reasoning Alignment","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-08T03:13:07.963343Z"},"links":{"cited_paper":"/paper/2604.10506","citing_paper":"/paper/2607.06522"},"observation_digest":"sha256:65f85ab19f3663f302715d3ffb2fea83ef56c401e58d4a9f1432fa3cda328ada","observation_id":"59ab3e84-c3b9-4ca9-9af7-0014f97de02f","resolution":{"observed_at":"2026-07-08T03:14:31.638468Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.10506/citation-record","integrity":"/paper/2604.10506/integrity","json":"/paper/2604.10506/citation-record.json","paper":"/paper/2604.10506"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-16T04:42:52.370966Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":"2503.06669","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-07-10T23:07:47.895730Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","venue":"cs.RO","work_id":"f797e9ec-510f-43a7-8a0c-18009ce332e5","year":2025},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:3f48f1aa29182601a494170aa82510c5c2fceb58a10ea5fec316ca4448f4e54e","observation_id":"e0f9d5f2-4935-4446-8273-5f7f78ed5520","resolution":{"observed_at":"2026-05-11T15:09:24.919963Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08623","last_updated":"2025-03-10T16:17:30Z","snapshot_observed_at":"2026-08-16T13:35:01.742308Z","submitted_at":"2024-07-11T16:00:22Z","title":"Surpassing Cosine Similarity for Multidimensional Comparisons: Dimension Insensitive Euclidean Metric","version":4},"cited_work":{"arxiv_id":"2407.08623","doi":"10.48550/arxiv.2407.08623","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.08623","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"One-Vision, Any-Resolution: A General Framework for High-Resolution Vision-Language Understanding.arXiv preprint arXiv:2407.08623, 2024a","venue":"arXiv (Cornell University)","work_id":"6e508327-3b58-47ea-a1e7-74d814382f81","year":null},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2407.08623","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:de3ca51bdd061b55648ab46cfef179e4b6cbdf203868c87b99694defe44c7e88","observation_id":"39d35e26-3360-410a-8325-7721fc702ca9","resolution":{"observed_at":"2026-05-11T09:41:01.794011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":"1706.02677","doi":"10.48550/arxiv.1706.02677","metadata_source":"pith","pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","venue":"cs.CV","work_id":"f3dc32a4-cf81-467b-8ff4-3b2f21d3bf1f","year":2017},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:be43623b36540f5e355379e8d9f1059ec307441bff9382bd0e2ae71a3d976a18","observation_id":"804dfea6-33a5-482d-8986-eef411c84a4e","resolution":{"observed_at":"2026-05-12T07:20:31.604247Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:09.485311+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:09.485311+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13064","last_updated":"2024-05-29T00:00:25Z","snapshot_observed_at":"2026-08-16T13:48:23.746007Z","submitted_at":"2024-05-29T00:00:25Z","title":"On the modification and revocation of open source licences","version":1},"cited_work":{"arxiv_id":"2407.13064","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.13064","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"SEED-1.6: A Comprehensive Multimodal Large Language Model for Diverse Tasks and Long-Context Understanding.arXiv preprint arXiv:2407.13064","venue":null,"work_id":"93ead54d-ac6a-400f-bdad-1e99d39131fa","year":null},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2407.13064","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:5127bbefb417ee5a786c924cabc93201a86557e5c53fd9685595119b2368ceb1","observation_id":"9e6523ea-ac96-4fe2-9022-b7d9c3b5fddc","resolution":{"observed_at":"2026-05-11T09:41:01.822915Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04468","last_updated":"2026-04-25T07:16:42Z","snapshot_observed_at":"2026-08-03T08:48:57.969106Z","submitted_at":"2024-12-05T18:59:55Z","title":"NVILA: Efficient Frontier Visual Language Models","version":3},"cited_work":{"arxiv_id":"2412.04468","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.04468","snapshot_observed_at":"2026-07-04T16:39:58.306201Z","title":"NVILA: Efficient Frontier Visual Language Models","venue":"cs.CV","work_id":"a8e505f5-ef0f-4236-b69a-2647902e00d7","year":2024},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2412.04468","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:e8d62c81f023cd03ff05d9714e0f0e594cbc99be65bf99ba3ccbb997ec36703b","observation_id":"2b981b61-9835-4d9f-ad5f-fac46f34d757","resolution":{"observed_at":"2026-05-11T09:41:01.759826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:e33cab6a6c10fbe055f63cfc5d09d3a7a548b4bd8b9f97d14b1b7957e7875807","observation_id":"c1f6976b-ab0d-48b3-9060-0279b1ac953a","resolution":{"observed_at":"2026-05-11T09:41:01.855632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16435","last_updated":"2023-05-25T19:20:19Z","snapshot_observed_at":"2026-08-16T15:29:34.272204Z","submitted_at":"2023-05-25T19:20:19Z","title":"Composing Bridges","version":1},"cited_work":{"arxiv_id":"2305.16435","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.16435","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Perception Test: A Diagnostic Benchmark for Multimodal Models.arXiv preprint arXiv:2305.16435","venue":null,"work_id":"02288670-eb8f-4996-acc1-fd3193d4baa1","year":null},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2305.16435","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:863cf997d09236bf731430f6e043e14a23661b512b7e6747ea66866f68df6442","observation_id":"1aacd13c-734c-4295-91bc-01ac0155a1c6","resolution":{"observed_at":"2026-05-11T09:41:01.896580Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02981","last_updated":"2024-06-07T08:44:52Z","snapshot_observed_at":"2026-08-16T13:46:00.907207Z","submitted_at":"2024-06-05T06:23:49Z","title":"Local vs. Global Interpretability: A Computational Complexity Perspective","version":2},"cited_work":{"arxiv_id":"2406.02981","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.02981","snapshot_observed_at":"2026-07-02T19:27:18.545706Z","title":"Video-CoT: A Multimodal Chain of Thought Agent for Video Reasoning.arXiv preprint arXiv:2406.02981","venue":null,"work_id":"32572514-b483-4e39-a46b-88186224206e","year":null},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2406.02981","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:9a17e004b4056aaccacc8d02ef160f6f3ef26fe31aec270a8e69514ec6380e50","observation_id":"6a4c00ee-46b3-40e3-8923-71ae8a9a5fbd","resolution":{"observed_at":"2026-05-11T09:41:01.785215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03229","last_updated":"2024-08-16T02:46:32Z","snapshot_observed_at":"2026-08-18T04:38:39.802178Z","submitted_at":"2024-04-04T06:29:42Z","title":"Relation between the keV-MeV and TeV emission of GRB 221009A and its implications","version":2},"cited_work":{"arxiv_id":"2404.03229","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.03229","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reward-VLM: A Reward-centric Vision-Language Model for Autonomous Driving.arXiv preprint arXiv:2404.03229","venue":null,"work_id":"b6a3fd12-11d6-459e-a157-a5027ab41048","year":null},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2404.03229","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:83d1323612cadc38d6a2630bff3bc26c4301ac2768d0191920777fb033679b53","observation_id":"883bd1eb-44d5-42f6-af33-99d11bbb71a6","resolution":{"observed_at":"2026-05-11T09:41:01.838513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":"2412.10302","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-07-10T13:27:05.559849Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","venue":"cs.CV","work_id":"0fa0432e-2510-462b-954d-436d3b669375","year":2024},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:559e388bad796d255a364bf6c4f56b9a9e06cfce6fb030b0a22fb6d17c89734c","observation_id":"25f711df-b3a4-4442-a632-63840a22a4b8","resolution":{"observed_at":"2026-05-11T10:09:32.945221Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07750","last_updated":"2023-08-15T13:06:34Z","snapshot_observed_at":"2026-08-16T15:08:22.764074Z","submitted_at":"2023-08-15T13:06:34Z","title":"Novel $H(\\mathrm{sym} \\mathrm{Curl})$-conforming finite elements for the relaxed micromorphic sequence","version":1},"cited_work":{"arxiv_id":"2308.07750","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2308.07750","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Skylark: A Multi-modal Large Language Model for General-purpose Instruction Following.arXiv preprint arXiv:2308.07750","venue":null,"work_id":"32d27bd5-a850-4bfe-99e7-33b541381d47","year":null},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2308.07750","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:cb92385c6c9522691c62593861e711aedcec8ee6d3a056d5adefaf40f93ab535","observation_id":"deb80c75-d03d-45a0-88dd-ebb85acb1217","resolution":{"observed_at":"2026-05-11T09:41:01.903053Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16270","last_updated":"2024-05-25T15:14:01Z","snapshot_observed_at":"2026-08-16T13:49:27.935097Z","submitted_at":"2024-05-25T15:14:01Z","title":"Complexity of Multiple-Hamiltonicity in Graphs of Bounded Degree","version":1},"cited_work":{"arxiv_id":"2405.16270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.16270","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X.-E., and Levine, S","venue":null,"work_id":"0b086eae-9b31-4e11-863d-2311deb398c3","year":null},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2405.16270","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:c0802412eb81cc13bb154ae225dea1ddd5aadd39775777d017920b7cf7d66234","observation_id":"c5baa0f4-c316-431b-a70e-765a69a39388","resolution":{"observed_at":"2026-05-11T09:41:01.890769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23764","last_updated":"2026-05-23T03:42:56Z","snapshot_observed_at":"2026-08-13T16:52:15.861245Z","submitted_at":"2025-05-29T17:59:52Z","title":"MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence","version":3},"cited_work":{"arxiv_id":"2505.23764","doi":"10.48550/arxiv.2505.23764","metadata_source":"pith","pith_arxiv_id":"2505.23764","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mmsi-bench: A benchmark for multi-image spatial intelligence","venue":"cs.CV","work_id":"3c86b01a-2b7e-4a70-94c5-92bf4d05ad52","year":2025},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2505.23764","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:15a2c81188981bff70623a96c604ba13403c58f2d1e05f5f51f53baf861e2e17","observation_id":"2bde0eae-ac20-40cc-90b1-de24c00cd0b9","resolution":{"observed_at":"2026-05-26T02:02:26.295966Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:a3e60aa2533dbfc8c303d31e850c3e8e050f63ea217f03563e99be65816b7cc6","observation_id":"51135fcb-62cc-4db5-ac2e-48761b49e915","resolution":{"observed_at":"2026-05-12T18:12:27.664923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00493","last_updated":"2025-03-27T10:30:42Z","snapshot_observed_at":"2026-08-17T23:18:17.356871Z","submitted_at":"2024-11-30T14:28:53Z","title":"Video-3D LLM: Learning Position-Aware Video Representation for 3D Scene Understanding","version":2},"cited_work":{"arxiv_id":"2412.00493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00493","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-3d llm: Learning position-aware video representation for 3d scene understanding","venue":null,"work_id":"da32fb5f-071c-46f1-8736-5e93c754d926","year":2024},"citing_paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T15:53:52.775348Z"},"links":{"cited_paper":"/paper/2412.00493","citing_paper":"/paper/2604.10506"},"observation_digest":"sha256:c67c2369dad7204c1ab2bb47e9eeb692c1b151a65479ae2afb67fca7d8818bb3","observation_id":"6f6f27bb-e7d2-4e8a-8ae7-ca3dc3495693","resolution":{"observed_at":"2026-05-11T09:41:01.809714Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.10506","last_updated":"2026-04-12T07:48:44Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-11T08:06:20.026157Z","submitted_at":"2026-04-12T07:48:44Z","title":"A Progressive Training Strategy for Vision-Language Models to Counteract Spatio-Temporal Hallucinations in Embodied Reasoning"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":0,"verified_exact":11,"verified_fuzzy":0},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 1 inbound Pith citation observation for arXiv:2604.10506."}