{"as_of":"2026-08-15T09:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3de4cbd7972b03d9cfafaddfb212a4a44298d112750f399228a0a8a2305e7382","coverage":[{"denominator":208,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T05:26:04.960844Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":197,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:57:17.357726Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T16:15:06.198778Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-08T19:38:26.415599Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-19T11:55:30.048525Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2406.08035"},"observation_digest":"sha256:c1137cddeaf3eb2c377e3974fa8321b6bed5e30d30ab47dc3ed6f3d1f789f250","observation_id":"b01406b5-88b8-4a52-989b-02fc4a1d11d9","resolution":{"observed_at":"2026-05-19T11:55:30.168739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T14:57:17.357726Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17163","last_updated":"2026-05-26T01:50:12Z","snapshot_observed_at":"2026-08-13T12:30:50.129007Z","submitted_at":"2025-05-22T15:25:14Z","title":"OCR-Reasoning Benchmark: Unveiling the True Capabilities of MLLMs in Complex Text-Rich Image Reasoning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:17.357726Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2505.17163"},"observation_digest":"sha256:02cba8d9e15089011944bbbec6429a3a3b504c9fdcd52a2523f155dda4276b98","observation_id":"53713d88-b350-4739-9bce-0668ae3d9b80","resolution":{"observed_at":"2026-08-07T14:57:17.357726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T13:35:56.947387Z","title":"Seed1.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.21327","last_updated":"2025-05-27T15:23:23Z","snapshot_observed_at":"2026-08-08T22:42:35.699276Z","submitted_at":"2025-05-27T15:23:23Z","title":"MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T13:35:56.947387Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2505.21327"},"observation_digest":"sha256:a55db2fcc96f40d3c4aa46579faa7e5b11b3ef2aa9a50fd0f0ed4bfe03765e5a","observation_id":"c6a16b61-2b4e-4409-bea9-8c62caff5779","resolution":{"observed_at":"2026-08-07T13:35:56.947387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T13:14:01.890332Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22396","last_updated":"2025-05-28T14:24:02Z","snapshot_observed_at":"2026-08-09T06:04:09.043938Z","submitted_at":"2025-05-28T14:24:02Z","title":"Zooming from Context to Cue: Hierarchical Preference Optimization for Multi-Image MLLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:14:01.890332Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2505.22396"},"observation_digest":"sha256:d6203db31df4cf9a1572b062a205fc9df0e5110e90569033d09179519a49aea1","observation_id":"4681f850-b3f1-48c3-9422-1a801a1c9c6a","resolution":{"observed_at":"2026-08-07T13:14:01.890332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T12:02:41.732462Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00845","last_updated":"2025-08-17T12:17:48Z","snapshot_observed_at":"2026-08-07T16:09:18.251031Z","submitted_at":"2025-06-01T05:39:56Z","title":"Generalizable LLM Learning of Graph Synthetic Data with Post-training Alignment","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:02:41.732462Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.00845"},"observation_digest":"sha256:4762c435e7f946d070fc118a790f17f4f1309ca0fafb29b97aeae008d0c9558f","observation_id":"11484dac-1c3a-4667-965e-39c62904883d","resolution":{"observed_at":"2026-08-07T12:02:41.732462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T11:59:53.010003Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00893","last_updated":"2025-08-02T10:06:31Z","snapshot_observed_at":"2026-08-15T04:24:22.889365Z","submitted_at":"2025-06-01T08:26:34Z","title":"Affordance Benchmark for MLLMs","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:59:53.010003Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.00893"},"observation_digest":"sha256:7bed18d24494d1568d24cfcb504e56f8f80631057fbc56681c9f0fdd3140bd3f","observation_id":"45015151-b2e0-4234-9914-512f14f5603d","resolution":{"observed_at":"2026-08-07T11:59:53.010003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T11:15:27.691230Z","title":"Seed1.5-vl technical report.arXiv preprint arXiv:2505.07062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03131","last_updated":"2025-06-03T17:57:33Z","snapshot_observed_at":"2026-08-14T20:40:40.741621Z","submitted_at":"2025-06-03T17:57:33Z","title":"Native-Resolution Image Synthesis","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:15:27.691230Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.03131"},"observation_digest":"sha256:c6e6a42787be60a6b592e4347e34f48aaea87f9b8463d928b41952ba5a7ca306","observation_id":"b8dae6e2-b953-4ce0-8233-84253194770e","resolution":{"observed_at":"2026-08-07T11:15:27.691230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T10:55:14.663442Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04034","last_updated":"2025-06-04T14:56:57Z","snapshot_observed_at":"2026-08-07T10:46:30.489099Z","submitted_at":"2025-06-04T14:56:57Z","title":"Rex-Thinker: Grounded Object Referring via Chain-of-Thought Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:14.663442Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.04034"},"observation_digest":"sha256:cdfcbd5c9c58903d0eb1ad44057ee7b1c8fa9919f52ba2a842088005e73232b2","observation_id":"9dafa5e9-0b8a-4fa2-9642-9d47c1c28142","resolution":{"observed_at":"2026-08-07T10:55:14.663442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T10:29:06.482746Z","title":"Seed1.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05083","last_updated":"2025-06-06T13:18:12Z","snapshot_observed_at":"2026-08-09T20:03:07.167859Z","submitted_at":"2025-06-05T14:30:39Z","title":"SeedEdit 3.0: Fast and High-Quality Generative Image Editing","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:29:06.482746Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.05083"},"observation_digest":"sha256:e8d6bb414cae9c8b48f530967442890a15a71a529b1f6d90b2535848d67ae5e4","observation_id":"158538fa-a423-4af1-88ff-2d6458423bc2","resolution":{"observed_at":"2026-08-07T10:29:06.482746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T10:27:05.608221Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05328","last_updated":"2025-07-22T07:00:35Z","snapshot_observed_at":"2026-08-14T22:32:40.158221Z","submitted_at":"2025-06-05T17:58:33Z","title":"AV-Reasoner: Improving and Benchmarking Clue-Grounded Audio-Visual Counting for MLLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:05.608221Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.05328"},"observation_digest":"sha256:683974ba8a2c944ea0f1ac18c56aed1e3eb5ab9c68639b883056411bc08a59dd","observation_id":"2d5d455d-553e-4098-aa0f-ffc0607bc6b7","resolution":{"observed_at":"2026-08-07T10:27:05.608221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T10:28:48.410947Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05331","last_updated":"2025-06-05T17:59:02Z","snapshot_observed_at":"2026-08-13T22:09:13.914363Z","submitted_at":"2025-06-05T17:59:02Z","title":"MINT-CoT: Enabling Interleaved Visual Tokens in Mathematical Chain-of-Thought Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:48.410947Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.05331"},"observation_digest":"sha256:e7b54466792e54b84fa9b85b4546bf59f2230d027445cffdd354c276ad73b608","observation_id":"cad310a7-038b-468f-892f-0617b815aaeb","resolution":{"observed_at":"2026-08-07T10:28:48.410947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T05:35:01.306179Z","title":"5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07627","last_updated":"2025-06-09T10:45:35Z","snapshot_observed_at":"2026-08-13T06:22:44.193966Z","submitted_at":"2025-06-09T10:45:35Z","title":"Event-Priori-Based Vision-Language Model for Efficient Visual Understanding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:35:01.306179Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.07627"},"observation_digest":"sha256:fb7cd2b187b84f0e64171f5e343d446c6eea551680789090189c2e0f53215679","observation_id":"09a0e717-34f9-4ede-8d0e-d02ee2bae432","resolution":{"observed_at":"2026-08-07T05:35:01.306179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T04:27:39.665617Z","title":"Seed1.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10568","last_updated":"2025-08-27T03:34:57Z","snapshot_observed_at":"2026-08-13T20:45:09.381829Z","submitted_at":"2025-06-12T10:58:23Z","title":"DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:39.665617Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.10568"},"observation_digest":"sha256:770a4a0296bea04c6faa1ef22ab84df476592459857942b04aa14faef9e6e15d","observation_id":"b0e77c38-bd66-4c1c-afe5-753e6bd1b3bb","resolution":{"observed_at":"2026-08-07T04:27:39.665617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T04:17:57.636188Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10912","last_updated":"2026-06-02T18:21:07Z","snapshot_observed_at":"2026-08-12T16:47:38.631597Z","submitted_at":"2025-06-12T17:25:53Z","title":"Breaking Bad Molecules: Are MLLMs Ready for Structure-Level Molecular Detoxification?","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:17:57.636188Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.10912"},"observation_digest":"sha256:c7e3b53d47c7bc59c1a2d90992b324e27e6a4166de5981137426b8cf033e2467","observation_id":"f3654494-ed02-4745-968a-0a9d0153c134","resolution":{"observed_at":"2026-08-07T04:17:57.636188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-07T04:07:32.364515Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-14T21:22:01.870216Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:32.364515Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:8e6ffe29daa80b03e3e749675e66dd5fd220775a7cbe7a9d48d751ebc7a8a5e8","observation_id":"aa453ad4-0ad9-4b46-8019-78d046e0a629","resolution":{"observed_at":"2026-08-07T04:07:32.364515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2506.11991","last_updated":"2026-05-01T04:30:18Z","snapshot_observed_at":"2026-08-15T04:02:04.964450Z","submitted_at":"2025-06-13T17:47:43Z","title":"VGR: Visual Grounded Reasoning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T09:11:00.295700Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.11991"},"observation_digest":"sha256:cc6b3474911d99c739d70207b0bb4c833e97d1de4d30baab0b9489159472ff41","observation_id":"e29e291a-9035-460e-a735-6373514e41b5","resolution":{"observed_at":"2026-05-19T09:12:14.418167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-06T23:21:07.103228Z","title":"Seed1.5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-15T02:01:30.871459Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"reference_index":299,"source":"pdf_text","source_observed_at":"2026-08-06T23:21:07.103228Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.18504"},"observation_digest":"sha256:bdf07163f29bdeb7e2f2764e8eaee435e5ba1274c3abd81c7a764ff6130364d8","observation_id":"ffa2a57e-5e3f-4d75-bc21-1f6fa110169a","resolution":{"observed_at":"2026-08-06T23:21:07.103228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-06T21:58:35.866414Z","title":"Seed1.5-VL technical report.arXiv preprint arXiv:2505.07062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22992","last_updated":"2025-06-28T19:44:32Z","snapshot_observed_at":"2026-08-09T11:31:37.358797Z","submitted_at":"2025-06-28T19:44:32Z","title":"MARBLE: A Hard Benchmark for Multimodal Spatial Reasoning and Planning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:58:35.866414Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.22992"},"observation_digest":"sha256:8dda4293bd9935a463cb5ba13366c552543ea6d811ae3bb45c4c75e82d8ee238","observation_id":"f92bd1b7-0158-4d54-80f4-72785261939e","resolution":{"observed_at":"2026-08-06T21:58:35.866414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-06T21:27:40.663603Z","title":"Seed1.5-vl technical report.arXiv preprint arXiv:2505.07062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.24102","last_updated":"2025-06-30T17:51:25Z","snapshot_observed_at":"2026-08-12T05:33:56.515699Z","submitted_at":"2025-06-30T17:51:25Z","title":"DenseWorld-1M: Towards Detailed Dense Grounded Caption in the Real World","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:27:40.663603Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2506.24102"},"observation_digest":"sha256:651cf696ba5e380ae1db5d7b6dc6339c32ad9ad2e57effc3459bcd81043a908b","observation_id":"f811175c-171c-4137-a96b-46026a58ac04","resolution":{"observed_at":"2026-08-06T21:27:40.663603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T04:48:26.355351Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2507.01006"},"observation_digest":"sha256:d1bcd1d3b5f86ed0479cabd1bd1328c1d9b9a78e8956a9fda33e94278ab24f6e","observation_id":"31960e2f-eab4-4db4-a130-b6b293d6ee4e","resolution":{"observed_at":"2026-05-11T05:26:06.820639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-06T20:47:28.125248Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-08-12T20:24:27.893763Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:47:28.125248Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2507.02029"},"observation_digest":"sha256:17558524d46fe72949955ff92871b59651e94a5adfd364ca75d0d03fe036eae0","observation_id":"c67bc056-83d2-4264-83f5-d7a24b974d02","resolution":{"observed_at":"2026-08-06T20:47:28.125248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2507.05791","last_updated":"2025-10-03T23:50:19Z","snapshot_observed_at":"2026-07-30T10:31:35.758747Z","submitted_at":"2025-07-08T08:52:18Z","title":"GTA1: GUI Test-time Scaling Agent","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T13:54:59.938216Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2507.05791"},"observation_digest":"sha256:57949ff3a15add1e790f0d91db16fd4eb1d9ee8162c37c386947a48c3f1249e9","observation_id":"93cdf003-0ea1-4adb-ae41-92f3d9eff97f","resolution":{"observed_at":"2026-05-17T13:55:00.062838Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-06T19:14:03.246738Z","title":"Seed1.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06167","last_updated":"2025-07-10T15:41:04Z","snapshot_observed_at":"2026-08-14T16:12:55.915203Z","submitted_at":"2025-07-08T16:47:16Z","title":"Skywork-R1V3 Technical Report","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:14:03.246738Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2507.06167"},"observation_digest":"sha256:8846edc6a706f3f570b55e9adaafd4732d4dbec500376c2df8e58f39715a5cea","observation_id":"595aabb9-7d61-48d2-a3f9-3f6748706de8","resolution":{"observed_at":"2026-08-06T19:14:03.246738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-06T19:14:15.299773Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06181","last_updated":"2025-07-08T17:03:39Z","snapshot_observed_at":"2026-08-07T16:09:15.554628Z","submitted_at":"2025-07-08T17:03:39Z","title":"CriticLean: Critic-Guided Reinforcement Learning for Mathematical Formalization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:14:15.299773Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2507.06181"},"observation_digest":"sha256:ba75a1414175a7ada672a74d43e18a06a75d91735805aff8445e9a612337ac83","observation_id":"5416e37a-3b9e-424a-b3df-ad990b0b24d5","resolution":{"observed_at":"2026-08-06T19:14:15.299773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-08-06T13:23:03.968769Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T08:04:12.433863Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2507.15493"},"observation_digest":"sha256:d6961046f4a024d676f75cee12178fcc425263865b988459c37e8d6541157202","observation_id":"a61bccae-b27c-4896-903c-de4f5ce04ff3","resolution":{"observed_at":"2026-05-17T08:04:12.591241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-06T13:23:30.295036Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20766","last_updated":"2025-08-07T09:53:15Z","snapshot_observed_at":"2026-08-14T23:16:41.496277Z","submitted_at":"2025-07-28T12:21:19Z","title":"Learning Only with Images: Visual Reinforcement Learning with Reasoning, Rendering, and Visual Feedback","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T13:23:30.295036Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2507.20766"},"observation_digest":"sha256:d2fe27ed3aa99bc8997679711f8fe36ab35af89f56a2717d84c5ac8a2e1791aa","observation_id":"0675370e-914a-4442-8602-b557c2ee1f04","resolution":{"observed_at":"2026-08-06T13:23:30.295036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-06T11:35:11.788450Z","title":"Seed1.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22607","last_updated":"2025-07-31T09:09:45Z","snapshot_observed_at":"2026-08-13T02:58:31.453226Z","submitted_at":"2025-07-30T12:23:21Z","title":"VL-Cogito: Progressive Curriculum Reinforcement Learning for Advanced Multimodal Reasoning","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T11:35:11.788450Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2507.22607"},"observation_digest":"sha256:18f135ac9ed5c9cfbce7616fea7f752fe448906c41aa4e407ef38d4b1821e118","observation_id":"5674d609-ce4d-4451-9ee5-3abafcfda2f3","resolution":{"observed_at":"2026-08-06T11:35:11.788450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-06T05:25:57.361418Z","title":"Kai Hu, Feng Gao, Xiaohan Nie, Peng Zhou, Son Tran, Tal Neiman, Lingyun Wang, Mubarak Shah, Raffay Hamid, Bing Yin, and Trishul Chilimbi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.01874","last_updated":"2025-08-03T18:09:40Z","snapshot_observed_at":"2026-08-11T15:57:37.240730Z","submitted_at":"2025-08-03T18:09:40Z","title":"Diffractive electroproduction of light vector particles: leading Fock-state contribution in the presence of significant higher Fock-state effects","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T05:25:57.361418Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2508.01874"},"observation_digest":"sha256:a084fd72630701dcbfdd039d43f8c7775465c52f8c9c1f3077f51863b018c917","observation_id":"cbacbe79-cebe-4d20-9405-6e8e68f8c647","resolution":{"observed_at":"2026-08-06T05:25:57.361418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-05T23:29:13.766583Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05383","last_updated":"2025-08-07T13:31:21Z","snapshot_observed_at":"2026-08-08T12:45:30.983934Z","submitted_at":"2025-08-07T13:31:21Z","title":"StructVRM: Aligning Multimodal Reasoning with Structured and Verifiable Reward Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T23:29:13.766583Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2508.05383"},"observation_digest":"sha256:f0975742a17199cc711f93e2342cc9af817d925fd41465a9ce669435e3fb6140","observation_id":"80ad6a69-6d28-470a-a1e7-4609fbb6fd38","resolution":{"observed_at":"2026-08-05T23:29:13.766583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-05T23:25:47.893839Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.05388","last_updated":"2025-08-07T13:38:49Z","snapshot_observed_at":"2026-08-06T12:42:41.700036Z","submitted_at":"2025-08-07T13:38:49Z","title":"An Explainable Machine Learning Framework for Railway Predictive Maintenance using Data Streams from the Metro Operator of Portugal","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T23:25:47.893839Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2508.05388"},"observation_digest":"sha256:56409f0543f6c4f17b5ad4fea816790c986a3f4dfd47a4e9abeee9c54875df9f","observation_id":"79f9783d-e128-445a-a1dc-9c3c90ce629d","resolution":{"observed_at":"2026-08-05T23:25:47.893839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-05T20:21:06.466198Z","title":"Seed1.5-vl technical report.CoRR, abs/2505.07062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-13T06:01:10.639866Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:06.466198Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:579a386688efd13d7f1fa8936aadaa578f02837ecea020f6ee2ba390b2f081ce","observation_id":"baf71de0-f6fb-4fa1-b7ac-c21f72141e0a","resolution":{"observed_at":"2026-08-05T20:21:06.466198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-13T04:48:56.237545Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:397f79f47b779775ce06fe09b486a0143712503017d89f1d284e51465854928b","observation_id":"00ceeeda-b9c8-4dc3-82ac-78f64201205f","resolution":{"observed_at":"2026-05-11T05:26:06.820639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-05T15:18:52.028713Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20018","last_updated":"2025-08-27T16:27:19Z","snapshot_observed_at":"2026-08-08T06:36:18.346761Z","submitted_at":"2025-08-27T16:27:19Z","title":"SWIRL: A Staged Workflow for Interleaved Reinforcement Learning in Mobile GUI Control","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T15:18:52.028713Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2508.20018"},"observation_digest":"sha256:88fc8e6a0c27e28668872fd539805d55c2ba88534a421256396d364624217821","observation_id":"6a21393a-2d07-49a2-841b-36ec9af8bfe8","resolution":{"observed_at":"2026-08-05T15:18:52.028713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-05T14:42:21.036423Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21113","last_updated":"2025-09-02T13:37:38Z","snapshot_observed_at":"2026-08-05T14:42:19.666014Z","submitted_at":"2025-08-28T17:48:19Z","title":"R-4B: Incentivizing General-Purpose Auto-Thinking Capability in MLLMs via Bi-Mode Annealing and Reinforce Learning","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T14:42:21.036423Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2508.21113"},"observation_digest":"sha256:7f9f9b957189f7bed218694fc6791d1764219536ed5dd2ac6ff9c0194fceddc0","observation_id":"08b242fd-5c6d-43ba-a046-fa0521f1fdcc","resolution":{"observed_at":"2026-08-05T14:42:21.036423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-05T14:03:35.711374Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21767","last_updated":"2025-08-29T16:40:57Z","snapshot_observed_at":"2026-08-13T07:42:36.869987Z","submitted_at":"2025-08-29T16:40:57Z","title":"UItron: Foundational GUI Agent with Advanced Perception and Planning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:03:35.711374Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2508.21767"},"observation_digest":"sha256:034c5cc32ba37b8cc17dcbd3e573dfc09df9a6ed6e15edd54b59780812bdeab3","observation_id":"28ade166-9d20-4a20-a2c6-5e656d96b080","resolution":{"observed_at":"2026-08-05T14:03:35.711374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-05T12:59:04.402669Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.01106","last_updated":"2025-09-11T12:40:54Z","snapshot_observed_at":"2026-08-12T20:25:08.144001Z","submitted_at":"2025-09-01T03:53:47Z","title":"Robix: A Unified Model for Robot Interaction, Reasoning and Planning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T12:59:04.402669Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2509.01106"},"observation_digest":"sha256:6e24d8fb774cff48fb9678e85f237aa13ffe3f951853ef9462236d3209dfac7a","observation_id":"cef2c61f-7ab2-4e5c-9639-9b34512f8f88","resolution":{"observed_at":"2026-08-05T12:59:04.402669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-05T12:28:26.527163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.01563","last_updated":"2025-09-07T13:40:44Z","snapshot_observed_at":"2026-08-14T03:18:34.925260Z","submitted_at":"2025-09-01T15:46:58Z","title":"Kwai Keye-VL 1.5 Technical Report","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T12:28:26.527163Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2509.01563"},"observation_digest":"sha256:3dec2f95cf3f701aaf78a8a6f2c6c78787b014039300268965e9f812858c66c0","observation_id":"af8abafb-9638-4e7b-b7ad-0ef1fd8de52c","resolution":{"observed_at":"2026-08-05T12:28:26.527163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-04T20:28:58.597765Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.09731","last_updated":"2025-09-10T13:02:29Z","snapshot_observed_at":"2026-08-13T04:46:37.208763Z","submitted_at":"2025-09-10T13:02:29Z","title":"Benchmarking Vision-Language Models on Chinese Ancient Documents: From OCR to Knowledge Reasoning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T20:28:58.597765Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2509.09731"},"observation_digest":"sha256:f6010be84d2db051814b7481bca61ce997c2e0ebedc59cb8e4abe8b479e97821","observation_id":"9ae68a05-9103-4eaf-8053-81e0dc4ad9bc","resolution":{"observed_at":"2026-08-04T20:28:58.597765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2509.20427","last_updated":"2025-12-10T16:37:54Z","snapshot_observed_at":"2026-08-13T15:50:14.892321Z","submitted_at":"2025-09-24T17:59:04Z","title":"Seedream 4.0: Toward Next-generation Multimodal Image Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T16:39:00.828442Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2509.20427"},"observation_digest":"sha256:ebd1b3eae0659fd8e69f28db80b9ba46af74389a236ca7ab9ee0bab9b224bf51","observation_id":"9f6d2274-fe55-41f4-8389-1e9fe22a5061","resolution":{"observed_at":"2026-05-12T16:39:00.920258Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-15T07:34:12.195990Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:1f87a440ad1d742fa0e433796a901f47ea007d005f96116a2b1aa347fbc6109d","observation_id":"4e95f10a-35a2-499a-9591-3c343fe030d8","resolution":{"observed_at":"2026-05-17T13:25:31.987859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2509.23661","last_updated":"2025-12-14T14:18:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-28T05:52:55Z","title":"LLaVA-OneVision-1.5: Fully Open Framework for Democratized Multimodal Training","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T10:53:26.574350Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2509.23661"},"observation_digest":"sha256:020f60b771cd68243d4820e12d22b0d42f5201beb99dac28d1d372f65472f707","observation_id":"0ccb065e-fc53-4243-8d35-1912f4ee181b","resolution":{"observed_at":"2026-05-12T10:53:26.633881Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-04T13:38:36.451668Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.25991","last_updated":"2026-07-30T02:00:42Z","snapshot_observed_at":"2026-08-15T02:25:48.569686Z","submitted_at":"2025-09-30T09:26:32Z","title":"Towards Unified Multimodal Misinformation Detection in Social Media: A Benchmark Dataset and Baseline","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T13:38:36.451668Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2509.25991"},"observation_digest":"sha256:b355d3bcd21ae599e1ed24d192174bdbf7d0c1f49fdad1ae91036b9da43f0c5e","observation_id":"d2a72923-79c9-4ae0-8141-4550b7e18f87","resolution":{"observed_at":"2026-08-04T13:38:36.451668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2510.10073","last_updated":"2026-04-14T02:53:37Z","snapshot_observed_at":"2026-08-14T23:09:43.432150Z","submitted_at":"2025-10-11T07:18:12Z","title":"SecureWebArena: A Holistic Security Evaluation Benchmark for LVLM-based Web Agents","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T08:14:51.102085Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2510.10073"},"observation_digest":"sha256:188d49a87a97ec2e5f3a1785281d885a72b38efa588b665a049fd07175334ef2","observation_id":"c6b6c83a-6dca-4ec9-aed3-b060ce150775","resolution":{"observed_at":"2026-05-18T08:16:06.590003Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-04T09:25:54.595641Z","title":"Seed1.5-vl technical report.arXiv preprint arXiv:2505.07062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.15476","last_updated":"2026-07-04T04:20:15Z","snapshot_observed_at":"2026-08-14T22:20:04.981358Z","submitted_at":"2025-10-17T09:38:54Z","title":"SoK: Systematizing LLM Prompt Security: Taxonomies, Datasets, and Unified Evaluation of Attacks and Defenses","version":3},"reference_index":172,"source":"pdf_text","source_observed_at":"2026-08-04T09:25:54.595641Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2510.15476"},"observation_digest":"sha256:e6e4ef7cba2a1b23f70f31cc16541e9808354898614aa2d0784336dfd316f650","observation_id":"7c10bb39-a4fc-4495-9a3f-ceb07cb31b96","resolution":{"observed_at":"2026-08-04T09:25:54.595641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-03T21:37:07.589391Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.14592","last_updated":"2026-07-18T14:25:41Z","snapshot_observed_at":"2026-08-12T21:15:09.890371Z","submitted_at":"2025-11-18T15:33:49Z","title":"DSBench: A Comprehensive Benchmark for Evaluating External and In-Cabin Risks","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T21:37:07.589391Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2511.14592"},"observation_digest":"sha256:f375f207e8bb9c4ec148ae8f9c6310f0a3cd07ec85a230bfbc967858f0ea4b81","observation_id":"9f752b9d-7723-4de2-aa7b-efa6ad70be72","resolution":{"observed_at":"2026-08-03T21:37:07.589391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2511.16518","last_updated":"2026-04-28T11:37:12Z","snapshot_observed_at":"2026-08-13T19:00:10.952463Z","submitted_at":"2025-11-20T16:34:55Z","title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T20:40:54.096289Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2511.16518"},"observation_digest":"sha256:523d890d2a1db95071ae4904f360c2ce2f7780b5322ab421b69b8b515b7d0bae","observation_id":"63e80dff-649b-4887-be08-6a2e5abb1b77","resolution":{"observed_at":"2026-05-17T20:42:05.738526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2511.19972","last_updated":"2026-05-07T02:58:13Z","snapshot_observed_at":"2026-08-13T11:32:53.164514Z","submitted_at":"2025-11-25T06:31:57Z","title":"Boosting Reasoning in Large Multimodal Models via Activation Replay","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-17T05:05:48.682057Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2511.19972"},"observation_digest":"sha256:187068bb71d8469c94278586d19d6e679f770f6fd0764b6a423df801c2a7728f","observation_id":"33745277-755c-4e19-8869-9eae62425e40","resolution":{"observed_at":"2026-05-17T05:09:04.026356Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2512.03043","last_updated":"2026-04-28T12:07:36Z","snapshot_observed_at":"2026-08-13T15:37:47.305433Z","submitted_at":"2025-12-02T18:59:52Z","title":"OneThinker: All-in-one Reasoning Model for Image and Video","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-17T02:09:39.820651Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2512.03043"},"observation_digest":"sha256:61e6bfcc30d406c3c32905e7e728469920ea9a4c0b9a4aef7b456e7686f166cb","observation_id":"15010b91-8e2e-4448-afe6-bf85f8207e74","resolution":{"observed_at":"2026-05-17T02:11:26.581673Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-03T17:30:50.912992Z","title":null,"venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2512.09706","last_updated":"2026-06-04T08:39:05Z","snapshot_observed_at":"2026-08-14T03:01:03.770741Z","submitted_at":"2025-12-10T14:52:29Z","title":"Training One Model to Master Cross-Level Agentic Actions via Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T17:30:50.912992Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2512.09706"},"observation_digest":"sha256:24051229e1b85a515931c252b7c25cbde8c276d7e7a5a84e7496db3d5fa4cdf0","observation_id":"f9e5bdac-24fc-4247-8288-958bce8c4530","resolution":{"observed_at":"2026-08-03T17:30:50.912992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2512.10554","last_updated":"2026-04-02T03:14:28Z","snapshot_observed_at":"2026-08-11T12:33:58.665102Z","submitted_at":"2025-12-11T11:38:50Z","title":"Grounding Everything in Tokens for Multimodal Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T23:31:05.422935Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2512.10554"},"observation_digest":"sha256:8bd49f545ee2d332319db2203a2d9473afd98f3b78e965d5d165474db94c247e","observation_id":"49d30e0b-b72c-432e-bfeb-24d3a70d46b4","resolution":{"observed_at":"2026-05-16T23:31:21.904826Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2512.15693","last_updated":"2026-05-15T14:16:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-17T18:48:26Z","title":"Skyra: AI-Generated Video Detection via Grounded Artifact Reasoning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-21T16:43:11.995960Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2512.15693"},"observation_digest":"sha256:c99376a9573ba54915673f3626a74311ba0bb61d66644bf9d8e50f112d561392","observation_id":"8ef4a5d2-12b8-40ac-9ecd-cd22d91fc50c","resolution":{"observed_at":"2026-05-21T16:44:15.952662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-03T14:16:50.766906Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.21095","last_updated":"2026-07-11T09:04:48Z","snapshot_observed_at":"2026-08-14T07:02:25.973982Z","submitted_at":"2025-12-24T10:35:21Z","title":"UniRec-0.1B: Unified Text and Formula Recognition with 0.1B Parameters","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T14:16:50.766906Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2512.21095"},"observation_digest":"sha256:da0a41f78f4133056065fbad14d0ac8da9a0ae4fb64e42d75446311e8bc6e542","observation_id":"00b8b6ef-d0be-4677-88e4-d814d681dd06","resolution":{"observed_at":"2026-08-03T14:16:50.766906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-03T13:45:45.266385Z","title":"Seed1.5-vl technical report.arXiv preprint arXiv:2505.07062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.23351","last_updated":"2026-05-30T17:53:31Z","snapshot_observed_at":"2026-08-04T07:16:25.094035Z","submitted_at":"2025-12-29T10:23:22Z","title":"CountGD++: Generalized Prompting for Open-World Counting","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-03T13:45:45.266385Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2512.23351"},"observation_digest":"sha256:51e10efed316c1302a01a4032d871c78f184e4a5c2bb7c8b1936a6f577c48ba0","observation_id":"3b153076-3b0f-4b79-9444-d69987996b3c","resolution":{"observed_at":"2026-08-03T13:45:45.266385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-03T10:43:50.244864Z","title":"Seed1. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.09118","last_updated":"2026-07-16T14:44:01Z","snapshot_observed_at":"2026-08-12T20:18:45.547153Z","submitted_at":"2026-01-14T03:35:09Z","title":"LPCAN: Lightweight Pyramid Cross-Attention Network for Rail Surface Defect Detection Using RGB-D Data","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-03T10:43:50.244864Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2601.09118"},"observation_digest":"sha256:b5530d331c2956cd1faff3acdb11324f3ce09b566d6516d87c65089d76dee622","observation_id":"bed1ebcf-69f7-4e96-9e5a-9f763a375257","resolution":{"observed_at":"2026-08-03T10:43:50.244864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-03T10:43:42.145651Z","title":"Seed1. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.09238","last_updated":"2026-07-16T14:45:17Z","snapshot_observed_at":"2026-08-10T07:54:29.987163Z","submitted_at":"2026-01-14T07:21:57Z","title":"Knowledge-Embedded and Hypernetwork-Guided Few-Shot Substation Meter Defect Image Generation Method","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T10:43:42.145651Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2601.09238"},"observation_digest":"sha256:67683ac68addbb2eb6a0cf04146affcd69f2d9be207250d6b9f875543dd788ad","observation_id":"0952cbb7-12ab-4624-af42-810838bc210f","resolution":{"observed_at":"2026-08-03T10:43:42.145651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2601.15724","last_updated":"2026-04-19T09:17:00Z","snapshot_observed_at":"2026-08-15T02:37:48.002238Z","submitted_at":"2026-01-22T07:47:29Z","title":"VideoThinker: Building Agentic VideoLLMs with LLM-Guided Tool Reasoning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T12:17:42.135851Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2601.15724"},"observation_digest":"sha256:a865fe5eea7d6eef4f019a85c91c4ff014684f97a60bb7f75521605884c99839","observation_id":"8e15eb89-a3f8-48b1-aeec-ab53b8a4d1ae","resolution":{"observed_at":"2026-05-16T12:17:51.869714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-03T06:01:38.768084Z","title":"org/CorpusID:274234014","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.00575","last_updated":"2026-07-25T06:54:35Z","snapshot_observed_at":"2026-08-13T13:15:10.309230Z","submitted_at":"2026-01-31T07:36:54Z","title":"Agentic Reward Modeling: Verifying GUI Agent via Progressive Trajectory-Grounded Interaction","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T06:01:38.768084Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2602.00575"},"observation_digest":"sha256:70c6021e0dc4cbcf04319deed2ac3e43245acdd5e228ceb349c494854e6801a0","observation_id":"2ac7a027-5a9b-492d-9e3f-e67bf1daad3e","resolution":{"observed_at":"2026-08-03T06:01:38.768084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T16:09:05.225767Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2602.02276"},"observation_digest":"sha256:7714569c8cabc523fe8810ca51bec5753031535a2119232ee53dd38326f5cb5a","observation_id":"77f142a9-63b0-4cb1-a101-7438cfd479a6","resolution":{"observed_at":"2026-05-11T05:26:06.820639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2602.06037","last_updated":"2026-05-01T09:36:02Z","snapshot_observed_at":"2026-08-11T16:15:54.233875Z","submitted_at":"2026-02-05T18:59:32Z","title":"Thinking with Geometry: Active Geometry Integration for Spatial Reasoning","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T06:39:29.010937Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2602.06037"},"observation_digest":"sha256:ee7ea69e3bc66a2fb630a47b092f8d7fa6925e8ab51d042814948d3ffefe2da6","observation_id":"c9d91b91-63b2-4212-ba47-7455d8f22b9d","resolution":{"observed_at":"2026-05-16T06:40:42.201090Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2602.07064","last_updated":"2026-04-07T13:49:35Z","snapshot_observed_at":"2026-08-11T15:55:44.194747Z","submitted_at":"2026-02-05T14:04:51Z","title":"OmniFysics: Towards Physical Intelligence Evolution via Omni-Modal Signal Processing and Network Optimization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T07:09:46.254851Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2602.07064"},"observation_digest":"sha256:23d161ab27af0fa7622f08aacf00943d7d1a7f6f818cc7ab59ae1cdc715243cd","observation_id":"f597c6e8-5eef-49d7-b298-43cfc185f295","resolution":{"observed_at":"2026-05-16T07:10:43.152968Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2602.12705","last_updated":"2026-04-07T11:35:36Z","snapshot_observed_at":"2026-07-06T22:45:44.135338Z","submitted_at":"2026-02-13T08:19:38Z","title":"MedXIAOHE: A Comprehensive Recipe for Building Medical MLLMs","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T22:52:30.992054Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2602.12705"},"observation_digest":"sha256:9f96418bdfbd34c9b457882b611c8a7587eaeb5284f2a48ef1c974555274ae99","observation_id":"d46b1046-30c1-4b3a-9694-0a43c78c9f30","resolution":{"observed_at":"2026-05-15T22:56:50.375022Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-02T22:08:39.921774Z","title":"Seed1.5-VL technical report.arXiv preprint arXiv:2505.07062,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.18527","last_updated":"2026-05-28T12:11:44Z","snapshot_observed_at":"2026-08-14T06:13:08.778212Z","submitted_at":"2026-02-20T04:06:07Z","title":"JAEGER: Joint 3D Audio-Visual Grounding and Reasoning in Simulated Physical Environments","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T22:08:39.921774Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2602.18527"},"observation_digest":"sha256:99709afe3ebb2156beedf9808262c1fdb72191d54b1c0d9f66e95cb2f7f33fbc","observation_id":"70193c6f-cc14-436f-8edf-b32e7c284204","resolution":{"observed_at":"2026-08-02T22:08:39.921774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-02T21:37:08.464741Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T13:04:30.544504Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:a5932705172cd7f4c61ee63ab4f7d783d25bf8740d74b4d56ffe0171255c03b2","observation_id":"25d4cdf8-7156-44a0-8371-ae0638bea619","resolution":{"observed_at":"2026-05-21T13:05:09.941488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-02T21:37:11.438697Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19710","last_updated":"2026-07-07T15:49:26Z","snapshot_observed_at":"2026-08-02T21:37:08.464741Z","submitted_at":"2026-02-23T11:00:08Z","title":"PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T21:37:11.438697Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2602.19710"},"observation_digest":"sha256:2f013aac531b9ea0165af8e5555ac6285dd9cead08a892516238c262f0a1f521","observation_id":"9158f500-ae05-4265-8f33-ca70f58be589","resolution":{"observed_at":"2026-08-02T21:37:11.438697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-02T19:56:28.590628Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00546","last_updated":"2026-07-15T15:03:39Z","snapshot_observed_at":"2026-08-14T16:31:24.738243Z","submitted_at":"2026-02-28T08:49:22Z","title":"Advancing Multimodal Judge Models through a Capability-Oriented Benchmark and MCTS-Driven Data Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T19:56:28.590628Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2603.00546"},"observation_digest":"sha256:09ec2b9d5c2f7ebeb53efd072836c1431b5f45f7aca8153fb0338a853eb3bd51","observation_id":"335b71fd-9a91-4702-bd6d-6032358880bd","resolution":{"observed_at":"2026-08-02T19:56:28.590628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-14T23:22:13.847876Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.10757","last_updated":"2026-06-20T10:12:15Z","snapshot_observed_at":"2026-08-13T21:01:04.544839Z","submitted_at":"2026-03-11T13:32:58Z","title":"CodePercept: Code-Grounded Visual STEM Perception for MLLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T23:22:13.847876Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2603.10757"},"observation_digest":"sha256:8355cff86408f3552148ef3a5552134d9bada16030418051a49654da921a0e16","observation_id":"e4f9eef8-ed59-4106-b25e-0304f4fb151c","resolution":{"observed_at":"2026-07-14T23:22:13.847876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2603.13779","last_updated":"2026-04-21T06:55:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-14T06:14:44Z","title":"AD-Copilot: A Vision-Language Assistant for Industrial Anomaly Detection via Visual In-context Comparison","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T11:54:18.587529Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2603.13779"},"observation_digest":"sha256:d9cf211e377a2d79dd39a153e16c675ba5e5a6fe04557f73c45bc0f45cc33dc3","observation_id":"c1cbe2ac-e98a-42db-8740-f94b9316b201","resolution":{"observed_at":"2026-05-15T11:55:33.279954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-13T23:59:10.664837Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.16100","last_updated":"2026-05-24T14:57:09Z","snapshot_observed_at":"2026-08-15T00:19:03.268574Z","submitted_at":"2026-03-17T03:49:55Z","title":"Reevaluating the Intra-Modal Misalignment Hypothesis in CLIP","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T23:59:10.664837Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2603.16100"},"observation_digest":"sha256:f9fa194bf9213c26f807e0aa908b7ff96296e6cc2b6f87a011a178b840574f08","observation_id":"705d5836-de75-4a73-a082-ccc5d2e8c2e7","resolution":{"observed_at":"2026-07-13T23:59:10.664837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-14T20:08:04.785209Z","title":"5-vl Technical Report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.26645","last_updated":"2026-07-13T17:23:53Z","snapshot_observed_at":"2026-08-12T14:36:11.684886Z","submitted_at":"2026-03-27T17:48:00Z","title":"Peel neighborhoods","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T20:08:04.785209Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2603.26645"},"observation_digest":"sha256:502340be4707e3da660ba54ebba97faf67572f1120833ad9965e59cd5a3a2feb","observation_id":"5d7687b2-011d-40ca-84c1-4979940d7d04","resolution":{"observed_at":"2026-07-14T20:08:04.785209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-02T17:05:13.857975Z","title":"5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29759","last_updated":"2026-07-16T04:13:36Z","snapshot_observed_at":"2026-08-14T15:51:18.914270Z","submitted_at":"2026-03-31T14:00:10Z","title":"TSHA: A Benchmark for Visual Language Models in Trustworthy Safety Hazard Assessment Scenarios","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T17:05:13.857975Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2603.29759"},"observation_digest":"sha256:2ab70295501ef489968043013a0cdf1477a3dff4489f43be68f9ea5f422f679b","observation_id":"20a792e4-84d9-46c4-892a-1ca8771ec2b4","resolution":{"observed_at":"2026-08-02T17:05:13.857975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.02880","last_updated":"2026-04-17T07:24:14Z","snapshot_observed_at":"2026-08-12T18:11:05.417821Z","submitted_at":"2026-04-03T08:44:45Z","title":"InstructTable: Improving Table Structure Recognition Through Instructions","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T20:53:57.029294Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.02880"},"observation_digest":"sha256:b67cefd851506649ceb4cd17dea5ead114a094b2791f2c28573b4d556f4f29ee","observation_id":"684d642b-a880-4338-a93b-9e3415a180a9","resolution":{"observed_at":"2026-05-13T20:58:16.051935Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.04707","last_updated":"2026-05-25T06:28:44Z","snapshot_observed_at":"2026-08-10T20:11:35.866439Z","submitted_at":"2026-04-06T14:19:48Z","title":"OpenWorldLib: A Unified Codebase and Definition of Advanced World Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T19:36:42.100191Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.04707"},"observation_digest":"sha256:feea97e5bb35c6909f10dcc98cf7ae9082f74c9f76d25add42f3b1661cbc8784","observation_id":"ca1359cd-6476-4fd8-96b4-b15426c2db73","resolution":{"observed_at":"2026-05-11T05:26:06.820639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-13T09:42:23.808691Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.04707","last_updated":"2026-05-25T06:28:44Z","snapshot_observed_at":"2026-08-10T20:11:35.866439Z","submitted_at":"2026-04-06T14:19:48Z","title":"OpenWorldLib: A Unified Codebase and Definition of Advanced World Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T09:42:23.808691Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.04707"},"observation_digest":"sha256:6c8696c6d5b4c83642b9d1b27cfcbeca62e78407636fad4b7c4b4df8c67914ec","observation_id":"9f7f9bfe-e4d0-46cf-86c9-40be3fad9562","resolution":{"observed_at":"2026-07-13T09:42:23.808691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.06777","last_updated":"2026-04-08T07:48:07Z","snapshot_observed_at":"2026-08-13T10:27:03.396626Z","submitted_at":"2026-04-08T07:48:07Z","title":"Walk the Talk: Bridging the Reasoning-Action Gap for Thinking with Images via Multimodal Agentic Policy Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T18:20:02.559108Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.06777"},"observation_digest":"sha256:a6f537b69043f21356c28d1cd1ab32043342353f721c69165f5ccb6754c602c2","observation_id":"51bd245e-7b26-474a-af68-f51e37231b67","resolution":{"observed_at":"2026-05-11T05:26:06.820639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.07296","last_updated":"2026-04-09T09:04:20Z","snapshot_observed_at":"2026-08-12T17:13:45.167547Z","submitted_at":"2026-04-08T17:03:02Z","title":"OpenSpatial: A Principled Data Engine for Empowering Spatial Intelligence","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T17:41:31.544716Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.07296"},"observation_digest":"sha256:4ed74b058f791102174b25db999248aef5690cbaf8d176112dc6353ff6fbfc4a","observation_id":"4729d643-ea08-4e50-874d-f574b59a4bc1","resolution":{"observed_at":"2026-05-11T06:20:56.579502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.07429","last_updated":"2026-04-08T17:49:03Z","snapshot_observed_at":"2026-08-13T21:52:06.857207Z","submitted_at":"2026-04-08T17:49:03Z","title":"GameWorld: Towards Standardized and Verifiable Evaluation of Multimodal Game Agents","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T17:57:36.038091Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.07429"},"observation_digest":"sha256:94991f8da3200e3681d7e1c8eedd50857ba3f6cc3032df9823d25f4f63fca9a6","observation_id":"c15ddaba-36c1-4d49-9990-edd8358fce2e","resolution":{"observed_at":"2026-05-11T05:46:07.941683Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.08014","last_updated":"2026-04-21T06:24:07Z","snapshot_observed_at":"2026-08-15T00:59:56.420699Z","submitted_at":"2026-04-09T09:14:00Z","title":"Bridging Time and Space: Decoupled Spatio-Temporal Alignment for Video Grounding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T18:38:16.204012Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.08014"},"observation_digest":"sha256:ebadc885a41bd4cb5320a7a0918d6ce6735fb0b852e18510389fb1a735757e1b","observation_id":"1313a7be-ad69-4774-a5ac-00d1a6eb1146","resolution":{"observed_at":"2026-05-11T05:26:06.820639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.08475","last_updated":"2026-04-21T11:35:00Z","snapshot_observed_at":"2026-08-13T19:33:19.245138Z","submitted_at":"2026-04-09T17:14:00Z","title":"LAMP: Lift Image-Editing as General 3D Priors for Open-world Manipulation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T16:58:06.892531Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.08475"},"observation_digest":"sha256:cfd7dd58f88da97db400ab017cd83e783ffe88039aabdc26066939f89775570d","observation_id":"f6083b10-d61c-459a-a5fa-761cc5435c5b","resolution":{"observed_at":"2026-05-11T07:50:57.521289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.09367","last_updated":"2026-05-27T14:52:01Z","snapshot_observed_at":"2026-08-11T16:23:24.282662Z","submitted_at":"2026-04-10T14:37:54Z","title":"EpiAgent: An Agent-Centric System for Ancient Inscription Restoration","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T17:02:05.265029Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.09367"},"observation_digest":"sha256:450e3cfc0890e4e15c6eb69c7180f49a529c13751f7be11c5155776f485d9e98","observation_id":"ac4bdaa8-d253-4395-9cd6-0c806ee9d2ce","resolution":{"observed_at":"2026-05-11T07:41:01.158961Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-12T23:17:40.794140Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.09367","last_updated":"2026-05-27T14:52:01Z","snapshot_observed_at":"2026-08-11T16:23:24.282662Z","submitted_at":"2026-04-10T14:37:54Z","title":"EpiAgent: An Agent-Centric System for Ancient Inscription Restoration","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-12T23:17:40.794140Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.09367"},"observation_digest":"sha256:6a514b6ba157d12a5bc4b9abb8a73ee945272e8f05ec46a148abf03e34ed1af9","observation_id":"9911c8e4-65b5-4c44-888e-b94494bbab64","resolution":{"observed_at":"2026-07-12T23:17:40.794140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.11006","last_updated":"2026-04-13T05:14:29Z","snapshot_observed_at":"2026-08-11T00:26:20.093955Z","submitted_at":"2026-04-13T05:14:29Z","title":"Towards Realistic 3D Emission Materials: Dataset, Baseline, and Evaluation for Emission Texture Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T15:12:42.995562Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.11006"},"observation_digest":"sha256:660e02508a8aa5c208bfc95f1c3f863b1032345e00833b3c58102679b6bde3e9","observation_id":"dc8eea66-cc36-4ae1-9e8e-f1e993ef632a","resolution":{"observed_at":"2026-05-11T11:01:05.280745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.11320","last_updated":"2026-04-13T11:22:37Z","snapshot_observed_at":"2026-08-12T15:02:46.916121Z","submitted_at":"2026-04-13T11:22:37Z","title":"CLASP: Closed-loop Asynchronous Spatial Perception for Open-vocabulary Desktop Object Grasping","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T16:42:02.271796Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.11320"},"observation_digest":"sha256:9cf9cab74b14dfc2d837b8730125912d66ba9c34974eb8a7149ab49db5e6742f","observation_id":"c343d3b9-ca6a-4f4e-acf0-5081ed2d6f6e","resolution":{"observed_at":"2026-05-11T08:20:59.855359Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.11627","last_updated":"2026-04-13T15:38:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T15:38:22Z","title":"POINTS-Long: Adaptive Dual-Mode Visual Reasoning in MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T15:23:08.671342Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.11627"},"observation_digest":"sha256:2e5d819c5aa23905220674421575706322b872b681264f5c7714360493e63f7d","observation_id":"bb5762b0-f8a7-4249-8fdd-0af5a468e403","resolution":{"observed_at":"2026-05-11T10:41:04.089096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.11789","last_updated":"2026-04-20T14:38:53Z","snapshot_observed_at":"2026-08-09T05:10:13.009841Z","submitted_at":"2026-04-13T17:55:02Z","title":"LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-10T15:35:37.095627Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.11789"},"observation_digest":"sha256:9a77e878746be6b53d8f011e1f19fa6bd3dda6452d16de730c8a50e4de074aa1","observation_id":"cd114e61-0326-430a-b985-10dfaf86ebbb","resolution":{"observed_at":"2026-05-11T10:11:04.630482Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.14029","last_updated":"2026-07-29T13:04:29Z","snapshot_observed_at":"2026-08-11T10:37:46.934045Z","submitted_at":"2026-04-15T16:09:37Z","title":"POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T13:09:24.304696Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.14029"},"observation_digest":"sha256:4714d973023b10a855cfa5443d24591296b703d81695cb1c63ce441889207a5f","observation_id":"1ad42240-2d80-4bc4-919a-06069a60de67","resolution":{"observed_at":"2026-05-11T05:26:06.820639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-08-02T16:18:20.921262Z","title":"5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.14029","last_updated":"2026-07-29T13:04:29Z","snapshot_observed_at":"2026-08-11T10:37:46.934045Z","submitted_at":"2026-04-15T16:09:37Z","title":"POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T16:18:20.921262Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.14029"},"observation_digest":"sha256:362bd2c8b53fe47f8102d9f736f06ea0ed1feacffa20826330929869ed997450","observation_id":"8b8c1bf1-2dd6-48d3-b435-21b9c24ecb7c","resolution":{"observed_at":"2026-08-02T16:18:20.921262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.14113","last_updated":"2026-04-15T17:32:28Z","snapshot_observed_at":"2026-08-15T06:16:29.532444Z","submitted_at":"2026-04-15T17:32:28Z","title":"UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T14:06:55.472857Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.14113"},"observation_digest":"sha256:e0c5776ecc76c7ca2a40e45db2d9780bdcb79e81c7635fa422223abe18ca3c52","observation_id":"99aedbb3-c5f6-44aa-9dfd-c2bc4e0c655c","resolution":{"observed_at":"2026-05-11T05:26:06.820639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-08-12T10:49:35.463190Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T13:34:36.248186Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.14148"},"observation_digest":"sha256:7f2b746b3275d5942b7d16cfc745e3c0af9d583e141774fc8de04c985c55b5c9","observation_id":"30c6fd44-077b-4ec3-a935-a855b3328712","resolution":{"observed_at":"2026-05-11T05:26:06.820639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.15809","last_updated":"2026-04-17T08:07:22Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T08:07:22Z","title":"Aligning What Vision-Language Models See and Perceive with Adaptive Information Flow","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T09:02:09.075097Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.15809"},"observation_digest":"sha256:1f78a97eb6f829dbdd95dccd781875a7c7d6d796f1b128a5b529af42e46a07ed","observation_id":"9fb25da2-9171-4cab-a7b5-87b2b715a864","resolution":{"observed_at":"2026-05-11T05:26:06.820639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.17195","last_updated":"2026-07-06T16:02:36Z","snapshot_observed_at":"2026-08-15T05:15:54.060716Z","submitted_at":"2026-04-19T01:51:41Z","title":"DreamShot: Personalized Storyboard Synthesis with Video Diffusion Prior","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T07:21:45.633310Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.17195"},"observation_digest":"sha256:6626dca51320c3a44baab1f4b8ccf29b6d6a0732188ba6ab503e1872dee6251d","observation_id":"b4feee8a-4cc1-4113-89e0-628590d048e3","resolution":{"observed_at":"2026-05-11T05:26:06.820639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.17385","last_updated":"2026-04-19T11:21:59Z","snapshot_observed_at":"2026-07-06T23:04:28.260463Z","submitted_at":"2026-04-19T11:21:59Z","title":"SpatialImaginer: Towards Adaptive Visual Imagination for Spatial Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T06:31:30.778309Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.17385"},"observation_digest":"sha256:f84108d6dd02ffd8ce69ca4bfac9a3062dbb157ae1ad0e37803884f3115fe95b","observation_id":"07575c65-6c00-4c56-98c5-3146de1aebdb","resolution":{"observed_at":"2026-05-11T05:26:06.820639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-10T05:42:41.112158Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:a590cfcdb650a219ff3702452f09849fc52e22bba68047bc06d7f83529fe5bc0","observation_id":"5f3ec7c3-edf9-44e2-9199-03e7af082812","resolution":{"observed_at":"2026-05-11T05:26:06.820639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.18486","last_updated":"2026-05-08T18:23:17Z","snapshot_observed_at":"2026-08-03T04:20:45.612992Z","submitted_at":"2026-04-20T16:37:22Z","title":"Xiaomi OneVL: One-Step Latent Reasoning and Planning with Vision-Language Explanation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T00:54:23.508845Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.18486"},"observation_digest":"sha256:4cf1bd1eae0493e28f69e7d06ae90cdb9ccb15a463b7a70e9a8b28c06231ecad","observation_id":"1298f9e2-02e3-458a-af07-8c4ef8c99a56","resolution":{"observed_at":"2026-05-12T08:36:25.937007Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.19858","last_updated":"2026-04-23T15:33:31Z","snapshot_observed_at":"2026-08-13T15:11:17.964100Z","submitted_at":"2026-04-21T17:58:58Z","title":"Wan-Image: Pushing the Boundaries of Generative Visual Intelligence","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T02:16:03.854650Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.19858"},"observation_digest":"sha256:ea000ba3e563bda30d6428a428f96ff492fa7062a2a7df1d769d22b6dd977723","observation_id":"3e3c3bf8-286b-42b4-a6d5-be387d7f8822","resolution":{"observed_at":"2026-05-11T13:11:04.111222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-08-13T08:49:02.121853Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:129cbd2b663cc19d23ba24203c9635e2cd833c69005eba18f5f750fab667d82f","observation_id":"7deaca6e-06fe-4c94-bbc3-8133b4d2ba07","resolution":{"observed_at":"2026-05-11T14:16:05.940196Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.22152","last_updated":"2026-04-24T01:50:53Z","snapshot_observed_at":"2026-08-07T19:37:35.121381Z","submitted_at":"2026-04-24T01:50:53Z","title":"dWorldEval: Scalable Robotic Policy Evaluation via Discrete Diffusion World Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T11:45:18.081248Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.22152"},"observation_digest":"sha256:5de17c463e31d3ad378b886c45c1dfcde3d1e0034b2bd59bb3f654e76c723e38","observation_id":"706b69ac-33c7-4e0e-86ba-b603988810b7","resolution":{"observed_at":"2026-05-11T19:31:09.545993Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.23996","last_updated":"2026-04-27T03:23:19Z","snapshot_observed_at":"2026-08-15T05:33:19.595727Z","submitted_at":"2026-04-27T03:23:19Z","title":"SMoES: Soft Modality-Guided Expert Specialization in MoE-VLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T04:41:52.098355Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.23996"},"observation_digest":"sha256:1de389d98af237fe9a72ba06a34ed652859db45f3a238d9735bad1d610e73097","observation_id":"a9231b2d-39e1-4c77-9296-b322c8ebba8f","resolution":{"observed_at":"2026-05-11T21:41:13.678645Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.24339","last_updated":"2026-04-27T11:31:15Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T11:31:15Z","title":"See Further, Think Deeper: Advancing VLM's Reasoning Ability with Low-level Visual Cues and Reflection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T04:46:16.497585Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.24339"},"observation_digest":"sha256:f84b24a74841a2f09070926fc90483f4c752863181a37d72ed74db8ce9ecae66","observation_id":"22df99a6-c8d7-4bcb-8dbc-02cb5f53f4ec","resolution":{"observed_at":"2026-05-11T21:36:17.378085Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.25380","last_updated":"2026-05-08T04:29:20Z","snapshot_observed_at":"2026-08-11T18:27:32.082776Z","submitted_at":"2026-04-28T08:43:58Z","title":"Benchmarking and Improving GUI Agents in High-Dynamic Environments","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-07T16:55:29.332273Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.25380"},"observation_digest":"sha256:5d81e7b22fbafa37cb4e1ebf59250c179d2821852af823e399e93ccd0bb4f3fa","observation_id":"7fb67bc8-972f-4fa8-a465-cab0cb1f9ec4","resolution":{"observed_at":"2026-05-11T23:31:13.993200Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2505.07062","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.07062","snapshot_observed_at":"2026-07-08T16:15:06.198778Z","title":"Seed1.5-VL Technical Report","venue":"cs.CV","work_id":"0e8e025f-ca1e-49cc-aee2-33f3a0201f3c","year":2025},"citing_paper":{"arxiv_id":"2604.25380","last_updated":"2026-05-08T04:29:20Z","snapshot_observed_at":"2026-08-11T18:27:32.082776Z","submitted_at":"2026-04-28T08:43:58Z","title":"Benchmarking and Improving GUI Agents in High-Dynamic Environments","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T00:54:49.351703Z"},"links":{"cited_paper":"/paper/2505.07062","citing_paper":"/paper/2604.25380"},"observation_digest":"sha256:4697049b5636d1296250e1f523a9d31ad80397113be64a7bef86d7388419bc5f","observation_id":"7d8bdbba-e9e2-4c21-af96-42e6b75f2e53","resolution":{"observed_at":"2026-05-11T05:26:06.820639Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.07062/citation-record","integrity":"/paper/2505.07062/integrity","json":"/paper/2505.07062/citation-record.json","paper":"/paper/2505.07062"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"144c2429-6010-4261-98eb-f2645e8a7c89","year":2023},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:cec0e457a9e0a520be35dda8220eb6d1e59772e062e140151d5aba33033299d5","observation_id":"afcfd011-6c93-41fd-a90d-904ea8bc7c11","resolution":{"observed_at":"2026-05-11T05:26:06.278271Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":"2404.14219","doi":"10.48550/arxiv.2404.14219","metadata_source":"pith","pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","venue":"cs.CL","work_id":"feef9556-a016-493c-abd2-0c97a23a7ebf","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:bf1e4c1b3b12b2e262df9fe76912b23cb5e06ac0c2a73c10f722702b6ba1a654","observation_id":"2fac0f76-f434-4805-9089-0cddead8d2fa","resolution":{"observed_at":"2026-05-11T05:26:06.205044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Countgd: Multi-modal open-world counting.Advances in Neural Information Processing Systems, 37:48810–48837","venue":null,"work_id":"0f8b00ac-7dc3-4d74-8956-c62ad1e7ecf7","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:45247925d98d26afeeec5230780c26b5278089d96a9fb0d518df240c5dbce0de","observation_id":"e43bdde6-fc62-4d79-83a5-a18769811fe9","resolution":{"observed_at":"2026-05-11T05:26:06.288023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02477","last_updated":"2024-07-02T17:55:03Z","snapshot_observed_at":"2026-08-14T12:55:10.046641Z","submitted_at":"2024-07-02T17:55:03Z","title":"Understanding Alignment in Multimodal LLMs: A Comprehensive Study","version":1},"cited_work":{"arxiv_id":"2407.02477","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.02477","snapshot_observed_at":"2026-07-03T01:07:30.306320Z","title":"arXiv preprint arXiv:2407.02477 , year=","venue":null,"work_id":"e5f87824-1df3-4fd0-8461-241f137fcb96","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2407.02477","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:ffadcfa5c3f402fce089e5c3c7c15d109801ad1e822f649a17e4a94c9ea40402","observation_id":"a1c198b8-abb0-44c3-b207-214fe00f3088","resolution":{"observed_at":"2026-05-11T05:26:06.032367Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude 3.7 sonnet system card","venue":null,"work_id":"c03ad2ab-948d-4485-b8e1-c1f09252a581","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:dfbe8d570dc70ff6331118cf599e84781ee622c3c7afb0081d757c5082d63756","observation_id":"f1bf4ed3-812b-4a0f-b4e2-a11f97f052f0","resolution":{"observed_at":"2026-05-11T05:26:06.294589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude’s extended thinking","venue":null,"work_id":"604b5fae-2b6c-42d3-a403-f342a8a5a875","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:ad5312636a940be7fce56511bdb95ff704c67e8390f4e85304ad669220c3cfdb","observation_id":"5d7fb1ab-4250-4767-bd01-d397437cc2cb","resolution":{"observed_at":"2026-05-11T05:26:06.299128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:9dfa0a8833f0d5df56d386c8dae87a251083f02fdf545198c3eaa8568c7fc799","observation_id":"d46de2ad-e269-45ff-a58b-31e1eeb1baac","resolution":{"observed_at":"2026-05-11T05:26:06.047883Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Objectnet: A large-scale bias-controlled dataset for pushing the limits of object recognition models","venue":null,"work_id":"f308fed2-ba1d-44b3-869a-9a612ba5620e","year":2019},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:4edf5401343cd6f7369c473154db51897a769f9404546bef11bb6d60f65f4cdd","observation_id":"1ca5c67f-9af3-438f-8585-b5e9c1637ef1","resolution":{"observed_at":"2026-05-11T05:26:06.303629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":"2111.08897","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-07-04T06:19:37.435697Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","venue":"cs.CV","work_id":"0ce910be-ca1c-44c7-b7b1-c5353759d85e","year":2021},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:bc098af5d54e5de307b8b5765c6569e312ef8a73079b6c4a95cad83abde38967","observation_id":"ae0a26b0-86c9-44c1-bcf6-1e8a0a4070b9","resolution":{"observed_at":"2026-05-15T10:47:09.105767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:44097d4d2f3e6893db3c6d3b00429ca1e3f8140375ab48d4c2802d42ad4b65bb","observation_id":"d0cb9a49-493f-49f8-a2a3-5ea434b3113c","resolution":{"observed_at":"2026-05-11T13:10:21.987351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08264","last_updated":"2024-09-13T20:17:13Z","snapshot_observed_at":"2026-08-12T22:46:03.239931Z","submitted_at":"2024-09-12T17:56:43Z","title":"Windows Agent Arena: Evaluating Multi-Modal OS Agents at Scale","version":2},"cited_work":{"arxiv_id":"2409.08264","doi":"10.48550/arxiv.2409.08264","metadata_source":"arxiv_reference","pith_arxiv_id":"2409.08264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Windows agent arena: Evaluating multi-modal os agents at scale.arXiv preprint arXiv:2409.08264","venue":"arXiv (Cornell University)","work_id":"9cce46f1-e894-43ff-b34d-06a8adfe4721","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2409.08264","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:95bb480c323ec3e918609bf7a26e1d8420b3b52ec63872a0f9dc8419cfce34fd","observation_id":"e7ed0343-1903-4b5c-b731-67e105619faf","resolution":{"observed_at":"2026-05-11T05:26:05.586427Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10818","last_updated":"2024-10-15T17:55:46Z","snapshot_observed_at":"2026-08-12T22:23:25.864838Z","submitted_at":"2024-10-14T17:59:58Z","title":"TemporalBench: Benchmarking Fine-grained Temporal Understanding for Multimodal Video Models","version":2},"cited_work":{"arxiv_id":"2410.10818","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.10818","snapshot_observed_at":"2026-07-03T23:39:03.234328Z","title":"Temporalbench: Benchmarking fine-grained temporal understanding for multimodal video models","venue":null,"work_id":"0f787776-4151-41f7-8d50-6174eb1340d3","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2410.10818","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:41fd654210223faae5392ce5c6f5c0991cb41597c60a4417ec6522c1c93a5d74","observation_id":"4d7bc3d6-cca5-45e2-9860-084fb8cfc5d9","resolution":{"observed_at":"2026-05-11T05:26:05.681583Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06858","last_updated":"2024-10-23T18:45:33Z","snapshot_observed_at":"2026-08-12T23:45:59.653222Z","submitted_at":"2024-06-11T00:17:39Z","title":"FLUX: Fast Software-based Communication Overlap On GPUs Through Kernel Fusion","version":5},"cited_work":{"arxiv_id":"2406.06858","doi":"10.48550/arxiv.2406.06858","metadata_source":"pith","pith_arxiv_id":"2406.06858","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Flux: Fast software-based communication over- lap on gpus through kernel fusion.arXiv preprint arXiv:2406.06858","venue":"cs.LG","work_id":"5d0e6adc-6dd2-49cc-8551-dc00433ed79f","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2406.06858","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:0f56cfb38948ce924591e0a00056b8abe292f40c37b07375ea934cef9e1d3e4f","observation_id":"b78cbcf5-abcd-4ff4-88d0-d514868036a1","resolution":{"observed_at":"2026-05-11T05:26:05.905725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.07155","last_updated":"2019-06-17T17:58:12Z","snapshot_observed_at":"2026-08-14T16:14:24.834759Z","submitted_at":"2019-06-17T17:58:12Z","title":"MMDetection: Open MMLab Detection Toolbox and Benchmark","version":1},"cited_work":{"arxiv_id":"1906.07155","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.07155","snapshot_observed_at":"2026-07-10T10:27:02.355587Z","title":"MMDetection: Open MMLab Detection Toolbox and Benchmark","venue":"cs.CV","work_id":"88b51c19-cd39-43c5-89fe-5c199a74250d","year":2019},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/1906.07155","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:e75c3dd164e05fb22bfd28553fee94686be49d7e55f17e546854222b9dd01146","observation_id":"7ee4d3bb-01e7-41cf-86b4-87ff10d51410","resolution":{"observed_at":"2026-05-11T05:26:05.955218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":"2403.20330","doi":"10.48550/arxiv.2403.20330","metadata_source":"pith","pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","venue":"cs.CV","work_id":"0d0b977c-a42e-49b1-869e-b7360dca5282","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:bb16ede4d0939e461c85e4fee8d4c29a0e2cac77d95fdf578fa7f9d11a48ff7b","observation_id":"2caeec6f-6c80-40cc-9668-6d42f76dcdf6","resolution":{"observed_at":"2026-05-12T19:41:44.612219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:20.921853+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:20.921853+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:02:40.820466Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"54368a18-c0d8-4d37-a4d5-76f352b7f497","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:7700afe25dc3a09ac16eb41b7c3af1a9cf6d980c1166fb681bfd6d5dfa115258","observation_id":"6dc2d73c-eed9-495b-9d1f-6eabae4a22a8","resolution":{"observed_at":"2026-05-11T05:26:06.311222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yolo-world: Real-time open- vocabulary object detection","venue":null,"work_id":"5b7abee4-cfc1-426b-b6b1-222c993260e7","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:027aaa7d631bd30e0b6017080d996e87e3b4ba94743c7e437ce10b302ca1ad30","observation_id":"52f4aac0-f2bf-4fc2-bb29-f3dc51fa2321","resolution":{"observed_at":"2026-05-11T05:26:06.318911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13315","last_updated":"2024-08-17T11:56:08Z","snapshot_observed_at":"2026-08-13T00:49:48.506095Z","submitted_at":"2024-03-20T05:37:24Z","title":"PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns","version":3},"cited_work":{"arxiv_id":"2403.13315","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.13315","snapshot_observed_at":"2026-07-02T23:57:28.214249Z","title":"PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns","venue":null,"work_id":"926e9650-5c7c-424c-a1db-2f5573108252","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2403.13315","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:16a9b50dae62733b1ef41c5e87ca9863894c7b4f1bfc008cfbcd600f52139dc2","observation_id":"44c2e2ee-1414-4644-a691-54fb50e9a9d3","resolution":{"observed_at":"2026-05-11T05:26:06.081961Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07752","last_updated":"2025-03-25T09:46:02Z","snapshot_observed_at":"2026-08-15T02:19:40.599979Z","submitted_at":"2024-10-10T09:28:36Z","title":"Lost in Time: A New Temporal Benchmark for VideoLLMs","version":3},"cited_work":{"arxiv_id":"2410.07752","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.07752","snapshot_observed_at":"2026-07-02T19:07:17.473192Z","title":"Lost in time: A new temporal benchmark for videollms","venue":null,"work_id":"8eb5b83d-8383-4120-a32e-cfa7e77ae46a","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2410.07752","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:84627f8c0fcf208228779d24ba4cfff1fbe3f53ff59b7dae56387d217fdcda3c","observation_id":"769e071d-a57c-4a42-a863-a23d22964c86","resolution":{"observed_at":"2026-05-11T05:26:06.098537Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Patch n’pack: Navit, a vision transformer for any aspect ratio and resolution","venue":null,"work_id":"09d8b9dc-55b9-4828-b8ba-77bd7bf0a8b0","year":2023},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:61c3b71b67dbfa6a841b8d260bb370fe14305ac42341162312b2bc0a0c836e82","observation_id":"e299bb67-faa1-4f78-a3cf-f2fe4ceb9ec0","resolution":{"observed_at":"2026-05-11T05:26:06.323904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2409.17146","doi":"10.48550/arxiv.2409.17146","metadata_source":"pith","pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","venue":"cs.CV","work_id":"b6841af7-2b88-4597-9d0e-54e96aa7a368","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:a7a6273ed266492a50fbb93cafd900f7534bbc7c8040ded54e34d69e0375304d","observation_id":"e4e88b71-6c17-4e55-9f22-d64811bd6c3d","resolution":{"observed_at":"2026-05-15T01:55:12.888993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:02:40.812309Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"06b732ce-772f-44d9-b956-eef4aec46a40","year":2009},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:3a4017094f4289794c846e3a16881155667076035e105d608ba2a06186fe5bc3","observation_id":"68302095-fe8b-43b9-aa82-07fa136a25dd","resolution":{"observed_at":"2026-05-11T05:26:06.328500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-08-12T23:40:46.200424Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2406.11832","doi":"10.48550/arxiv.2406.11832","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pixart-sigma: Weak-to-strong training of diffusion transformer for 4k text-to-image generation","venue":"arXiv (Cornell University)","work_id":"89919d42-8c59-4aa5-8229-9d3bed0670e3","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:246f921048e370239821b1c0160dd43620d78d58bdfef291acba7856fc3cd633","observation_id":"5c81fc57-ac1e-4e04-81bb-c0024add02cb","resolution":{"observed_at":"2026-05-11T05:26:05.462877Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13542","last_updated":"2024-07-18T09:00:23Z","snapshot_observed_at":"2026-08-12T23:39:12.754778Z","submitted_at":"2024-06-19T13:29:53Z","title":"Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models","version":3},"cited_work":{"arxiv_id":"2406.13542","doi":"10.48550/arxiv.2406.13542","metadata_source":"pith","pith_arxiv_id":"2406.13542","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-play with execution feedback: Improving instruction-following capabilities of large language models","venue":"cs.CL","work_id":"4820f50e-98c1-439f-89eb-e74ebe6bbb59","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2406.13542","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:5cf75993c10b84525702dd002e1d8dd517a9241ee18908c96d9872698eb162d8","observation_id":"c32d8719-ac79-4347-9124-6935b7d63034","resolution":{"observed_at":"2026-05-11T05:26:05.485132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:6bde13d44a6a454781561da670ec46c5b9016e8891dd64d04ac534a5283a2e6a","observation_id":"033ed50e-56d8-41f9-89f3-a6252a2938af","resolution":{"observed_at":"2026-05-11T05:26:05.491357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Counting out time: Class agnostic video repetition counting in the wild","venue":null,"work_id":"459b5287-fc1c-4d2e-b54d-fadac0c2ae8e","year":2020},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:cd667aa894064c7b568dfd064843983602a649d6256bac1d08dd10b68bfcf4c3","observation_id":"0744f927-0bff-469a-bd64-35c6682fd51c","resolution":{"observed_at":"2026-05-11T05:26:06.336018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-08-14T02:42:50.349648Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":"2309.17425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-07-04T20:50:12.674098Z","title":"arXiv preprint arXiv:2309.17425 (2023)","venue":null,"work_id":"9922937e-9c54-4233-8816-d729dfaf746e","year":2023},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:ebe49199d368724950029f4152643e85ea7637a5ac91d23d1bc36bd41a51779f","observation_id":"4c5f184d-9b44-4e23-a71a-19977cb6d7c2","resolution":{"observed_at":"2026-05-11T05:26:05.559184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eva: Exploring the limits of masked visual representation learning at scale","venue":null,"work_id":"6131c68f-052a-4d22-87ad-9f81556c7ba0","year":2023},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:1bbc6c784b49d3cfb5dac438cffc3a843e7790fb634221e889d8ed3f34735d35","observation_id":"4a417498-d993-4e04-8995-825af5143ba1","resolution":{"observed_at":"2026-05-11T05:26:06.341778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03505","last_updated":"2025-06-02T17:02:34Z","snapshot_observed_at":"2026-08-12T23:07:31.227800Z","submitted_at":"2024-08-07T02:08:29Z","title":"Optimus: Accelerating Large-Scale Multi-Modal LLM Training by Bubble Exploitation","version":2},"cited_work":{"arxiv_id":"2408.03505","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.03505","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Optimus: Accelerating large-scale multi-modal llm training by bubble exploitation","venue":null,"work_id":"7162dc27-58fd-486c-9b29-97410fdd50ff","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2408.03505","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:43902e1d66535f9db4e9ba8496097a5d0db345a77fc8a4fcc9870175ec13bde0","observation_id":"bfdebabc-c4ea-45fd-ad31-39e70d3dfba5","resolution":{"observed_at":"2026-05-11T05:26:05.608208Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Helix: A vision-language-action model for generalist humanoid control.https://www.figure.ai/ news/helix","venue":null,"work_id":"dbf23918-33f2-4f8a-8fdb-f6c66416649b","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:657596bdaa41fea93b5544bf27d61938df49c081153050520f5bab7426950834","observation_id":"1ef4e04e-0b5b-4f35-b2db-c16925e41dce","resolution":{"observed_at":"2026-05-11T05:26:06.348494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":"2405.21075","doi":"10.1609/icwsm.v17i1.22209","metadata_source":"pith","pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","venue":"cs.CV","work_id":"77fd5ac9-ae98-4846-9d83-e9c73c8f2a52","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:756792efd116cf93431e663429e851e9a5c5651d8b6efd4ad37f2d094489fd8c","observation_id":"53ca0743-daac-4203-b767-93aff87a3a4a","resolution":{"observed_at":"2026-05-11T05:26:05.774438Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T23:51:35.594632Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":"0f53fdf1-7151-4197-86a2-081455a42131","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:65820df1d40d45b5f0afd410755e1d026fa5b2e5285fd1281817118dfa37a42b","observation_id":"6516d9d2-cdca-414d-a6cc-52f0cb4445ce","resolution":{"observed_at":"2026-05-11T05:26:06.353238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:53:57.221351Z","title":"Tall: Temporal activity localization via language query","venue":null,"work_id":"3fff97ee-fb43-4bb7-adf2-e6f22813b5ea","year":2017},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:a1697f590436179e5db1b071f3122d1f49dd50e89f3e3a7ac67551d9cd228bd8","observation_id":"a70836d8-b460-4680-a901-79595d8f3d12","resolution":{"observed_at":"2026-05-11T05:26:06.357984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Experiment with gemini 2.0 flash native image generation.https://developers.googleblog.com/en/ experiment-with-gemini-20-flash-native-image-generation","venue":null,"work_id":"d354e6e1-547f-49ab-8446-e7ec1e4c5492","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:c94ca38450032f52fcd578e655804882de91ca613916ef81049981f27b629bfc","observation_id":"05887b6e-1f85-4531-b72f-50449df61832","resolution":{"observed_at":"2026-05-11T05:26:06.367407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.01615","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T00:17:29.102296Z","title":"Saliency-guided detr for moment retrieval and highlight detection","venue":null,"work_id":"ea8aa9d4-cd29-4221-a523-253d41141d10","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:7a55ae3eccc513dd92c44859701bd1ef27231c04b1c749165b46f67a5740465a","observation_id":"fc8c93b0-3905-4e7a-85c6-46a92376c5ed","resolution":{"observed_at":"2026-05-11T05:26:05.981905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:d32e9982fc5c739a0ae34b9b30e1823fbc1f37709bd4a7ffd0f5ce7ca0ee763c","observation_id":"30db478d-cbaf-4879-aa3b-5b22634ce670","resolution":{"observed_at":"2026-05-11T05:26:06.015925Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:42:39.726842Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":"ef2587ff-83e6-4146-b698-4879c73e6732","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:e89b8cc2dbc8fd8eb14df3054b9380cda8fe88f879fdf1c619bf017a0c58b6d5","observation_id":"49f84c85-9b74-4a42-87e5-1e7d4ceceb8a","resolution":{"observed_at":"2026-05-11T05:26:06.372253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2501.12948","doi":"10.1016/j.artmed.2024.103001","metadata_source":"pith","pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","venue":"cs.CL","work_id":"e6b75ad5-2877-4168-97c8-710407094d20","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:bd33c82583fbcde8c29d4391ec1050e332d3efb6944890419f5cc526ac38966c","observation_id":"9ffc2f68-d28e-4814-b09c-179010b8042f","resolution":{"observed_at":"2026-05-11T05:26:06.042133Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lvis: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"a49fffbb-b177-4e28-8a02-a4d83a395343","year":2019},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:5d24c24822e8e1adc5f09f0ef8de47d2c675568cd88d40f65520fd2d732fba3f","observation_id":"203ec044-cc71-4792-877f-e90610d595e9","resolution":{"observed_at":"2026-05-11T05:26:06.376984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":"2402.14008","doi":"10.48550/arxiv.2402.14008","metadata_source":"pith","pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","venue":"cs.CL","work_id":"19abed3b-0ff6-409b-aded-a50205319aa3","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:a12109d3a0c9d932022ce817452b9ecc3ae888c800267008d901ea7abcc0ccf3","observation_id":"d5ebee7c-323c-46ff-a9db-0e45abb7a7d2","resolution":{"observed_at":"2026-05-11T08:38:21.105975Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13919","last_updated":"2024-06-06T18:37:34Z","snapshot_observed_at":"2026-08-15T01:23:25.524198Z","submitted_at":"2024-01-25T03:33:18Z","title":"WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models","version":4},"cited_work":{"arxiv_id":"2401.13919","doi":"10.48550/arxiv.2401.13919","metadata_source":"pith","pith_arxiv_id":"2401.13919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebVoyager: Building an End-to-End Web Agent with Large Multimodal Models","venue":"cs.CL","work_id":"12c1d840-af20-4a4e-8750-6b9c6266638f","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2401.13919","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:a370b4ce2b6689d7fdaaf67bdc5ecfa2b399ef637cce65f37c6cc1a43962479a","observation_id":"37746a3e-98f4-4307-b361-d4434033f04f","resolution":{"observed_at":"2026-05-15T22:43:35.479641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":"a308953f-dd17-47ac-8d8d-e5667aa6bebc","year":2021},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:c40163c5458b97827ac5dcc74071951f6240fa09e706b5e1b948e85bcf3939e4","observation_id":"1b50b982-6127-4f1c-a8e5-3f58838874f7","resolution":{"observed_at":"2026-05-11T05:26:06.381706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Natural adversarial examples","venue":null,"work_id":"2f2b6c2a-4ec3-4c0e-8296-5a2b22931631","year":2021},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:08e6ff45bf353e8382c1b1ebab720d7891914e2c2d7fabafcab16d4f54d308b6","observation_id":"ff96f097-bebd-4349-a2aa-1db2fa5e4b6b","resolution":{"observed_at":"2026-05-11T05:26:06.391576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":"2010.14701","doi":"10.48550/arxiv.2010.14701","metadata_source":"pith","pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Autoregressive Generative Modeling","venue":"cs.LG","work_id":"1f180c21-02d6-4b11-9dfc-08d7f0d8fc81","year":2020},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:eefdbd0eb25edb60a1cfc21c52c64f9d4cf6dd3beca2edb146b622e7af56629b","observation_id":"0be140a3-ab89-4a5b-b008-ddf7dce85e9c","resolution":{"observed_at":"2026-05-13T07:49:43.923372Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":"2203.15556","doi":"10.1098/rsta.2024.0522","metadata_source":"pith","pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training Compute-Optimal Large Language Models","venue":"cs.CL","work_id":"b2faf28d-86b7-429c-bc42-469458efc246","year":2022},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:19626ed3e1a457c1c219cb3f18d55fae1968043d52efe1c62d860fa07f67b2db","observation_id":"6b7e3d2b-dca4-42e4-88c0-aad33465ab40","resolution":{"observed_at":"2026-05-11T05:26:06.128471Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":"1904.09751","doi":"10.48550/arxiv.1904.09751","metadata_source":"pith","pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Curious Case of Neural Text Degeneration","venue":"cs.CL","work_id":"1ef2ec4a-db7b-42b2-9416-0f1bb628c3c8","year":2019},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:0b5d2af6d7b4c48aad3e5875b135f1a3796f184910cb510582f9510fd8873266","observation_id":"48407459-62b0-4714-a90d-1bdd31dc1aaa","resolution":{"observed_at":"2026-05-12T06:18:24.042352Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-19T15:54:15.356125+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T15:54:15.356125+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02955","last_updated":"2026-05-12T15:02:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-06T11:57:38Z","title":"MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models","version":2},"cited_work":{"arxiv_id":"2501.02955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.02955","snapshot_observed_at":"2026-07-02T01:36:25.127081Z","title":"MotionBench: Benchmarking and Improving Fine-grained Video Motion Understanding for Vision Language Models","venue":"cs.CV","work_id":"a9a993eb-b18d-4306-8375-c036ac0de13a","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2501.02955","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:9ee0748adf60f5f01843ce9befc1a79b3b007d691f86b3622e83124054fdfe23","observation_id":"c389374c-5eab-4d3e-9c2a-c10924b44ed9","resolution":{"observed_at":"2026-05-13T02:48:11.661227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":"2501.13826","doi":"10.48550/arxiv.2501.13826","metadata_source":"pith","pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","venue":"cs.CV","work_id":"365a8624-64bf-45a7-8a3e-c575aba224dc","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:10238ce9eb1ca0575122f1f49cf044c9023ef556fc8277de02563f9ec606cdab","observation_id":"8b90fa82-393e-438c-9a3a-e2da6583651c","resolution":{"observed_at":"2026-05-14T00:32:41.480822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpipe: Efficient training of giant neural networks using pipeline parallelism","venue":null,"work_id":"20ce4658-7b5b-4263-bc3d-a7de43356c0e","year":2019},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:c4c209712a8b678e3fe0b00ab3557828992b167e799e379a980a9cf3e9e841fa","observation_id":"d872c490-ca22-425b-928f-5311fd07972b","resolution":{"observed_at":"2026-05-11T05:26:06.396470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00584","last_updated":"2025-04-17T10:10:16Z","snapshot_observed_at":"2026-08-14T02:56:46.282936Z","submitted_at":"2024-12-31T18:17:05Z","title":"Online Video Understanding: OVBench and VideoChat-Online","version":2},"cited_work":{"arxiv_id":"2501.00584","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.00584","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Online Video Under- standing: A Comprehensive Benchmark and Memory- Augmented Method","venue":null,"work_id":"dfb93eca-d643-48fe-befe-016a665764e2","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2501.00584","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:a04aa06dd3e6de447652dcd242f5df028e2ad9e717bbe2173add425049ed5d1a","observation_id":"f1005a7c-390d-42be-bba1-17b0d6d91301","resolution":{"observed_at":"2026-05-11T05:26:06.215670Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:02:40.789127Z","title":"Classification done right for vision-language pre-training","venue":null,"work_id":"d0e5a192-a181-4cd9-99a1-4af5c627ad57","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:1994a84083f4406ec05c5f40205a4dd9eb3404e53f3c37381d605aba3ebdf4e0","observation_id":"6182c567-ca84-41f4-a445-04c7b292a1db","resolution":{"observed_at":"2026-05-11T05:26:06.400636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/mcse.2007.55","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:17:45.473382Z","title":"D., 2007, @doi [Computing in Science and Engineering] 10.1109/MCSE.2007.55 , 9, 90","venue":"Computing in Science &amp; Engineering","work_id":"eb18b0c2-9ed0-4254-b208-425469f09e64","year":2007},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:2a454796b3df51fecdc45924f623b30663bbd5145603d94f2ef9941314a6d39c","observation_id":"602425a6-015e-4768-9605-dabf9c43e2e4","resolution":{"observed_at":"2026-05-11T05:26:05.347076Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T08:08:11.947291+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T08:08:11.947291+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-15T08:08:11.947291+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T05:02:49.183338Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:c8866b3c4cf1a71ea5b7c2a84c4029cc2f990e38152f50ef5d8412e2af1135ad","observation_id":"4b45629c-a7b9-4085-a3e9-431dd431efec","resolution":{"observed_at":"2026-05-11T05:26:05.379349Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":"2504.16054","doi":"10.1609/aaai.v40i28.39562","metadata_source":"pith","pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","venue":"cs.LG","work_id":"d1ad7304-d09a-49bc-809e-846439f6aff9","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:7f97d7218fcb2eff4b93f8bf7dbb3112f272389718af6593565721187b9e5a42","observation_id":"b67af7ca-89d7-4017-8dcd-a9aed805bb63","resolution":{"observed_at":"2026-05-11T05:26:05.406172Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":"2412.16720","doi":"10.48550/arxiv.2412.16720","metadata_source":"pith","pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI o1 System Card","venue":"cs.AI","work_id":"68d3c334-0fc9-49e3-b7b0-a69afae933e2","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:9c661b542cd06050a18ac53460b6461abdca8c0bf5c3f2afaf22908a2ad6bfe2","observation_id":"b05d473d-0521-41c9-a644-524f69447186","resolution":{"observed_at":"2026-05-11T05:26:05.415512Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In 21st USENIX Symposium on NetworkedSystems Design and Implementation (NSDI 24), pages 745–760","venue":null,"work_id":"6f68419e-8f2c-4f6b-9d7e-daf421d30482","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:7f2338fb905093eb6373844316597b25b06694ed34be35f327bff361cb78d4b3","observation_id":"309dea63-518c-4c51-af93-3783303ff936","resolution":{"observed_at":"2026-05-11T05:26:06.404958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.07300","last_updated":"2018-02-22T22:50:42Z","snapshot_observed_at":"2026-08-14T20:22:04.930480Z","submitted_at":"2017-10-19T18:01:38Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","version":2},"cited_work":{"arxiv_id":"1710.07300","doi":"10.48550/arxiv.1710.07300","metadata_source":"pith","pith_arxiv_id":"1710.07300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","venue":"cs.CV","work_id":"aa4d846d-b19b-47d6-b5c3-1f61acf0a6a0","year":2017},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/1710.07300","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:808e568e9c1d3783cc19b776c9bd7de6495fe9042bf19647c62966c8186b5ec5","observation_id":"3f3c3296-3673-4a32-a746-7c6ae81b6f56","resolution":{"observed_at":"2026-05-11T05:26:05.448721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:ee8a2ee18dcef92b15f955e9437d1d440c83a3fcfd31354fd7bee09446e4878c","observation_id":"7f19c731-9841-4029-9af4-962cfd0fea24","resolution":{"observed_at":"2026-05-11T05:26:05.456643Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":"5ac7afed-a9d2-4118-9502-9072ef4b639d","year":2014},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:5205de4da3c7d9f65094631b34b5b6accbf14605fea93593aff857e7bf451d03","observation_id":"8ff76b86-eaa7-46f9-9c10-6a321a390258","resolution":{"observed_at":"2026-05-11T05:26:06.415359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"58e0e3e5-b2db-4a24-a112-476114c4bee8","year":2016},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:4498a56dd6b6a4892d7a9cf5d64d5d41c91c9cd7fa07ed7a929507a53e05ae1a","observation_id":"2ba3d0f2-ebc1-4318-91ba-aa660858ecc6","resolution":{"observed_at":"2026-05-11T05:26:06.423351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ocr-free document understanding transformer","venue":null,"work_id":"fd39186f-f459-4103-ab18-a5f703528f45","year":2022},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:6f442e3810e4125355adc4a55c0f9460c33da2451252838bc261fe51e23fa6ff","observation_id":"890d3d42-54dc-4fa6-8e10-aebe70c29ca4","resolution":{"observed_at":"2026-05-11T05:26:06.429262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":"4e045b7d-6a87-4ea4-b04d-177d3ca20826","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:65cb87b881c69d0751a06f374fdf2411c1e0d9ad9e21814cd18b9f4ea9d4603e","observation_id":"1c6a1699-9822-4bb0-adc9-e031f6a7bbfe","resolution":{"observed_at":"2026-05-11T05:26:06.439687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:b8497bf89a36fdeadcfe1a5ed4fe346d53cdd964d8eee59793ef92e2ac301db0","observation_id":"12256451-28ef-4dea-9daa-58621d2d0fbd","resolution":{"observed_at":"2026-05-11T05:26:05.552726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reducing activation recomputation in large transformer models.Proceedings of Machine Learning and Systems, 5:341–353","venue":null,"work_id":"1e455259-8759-45e1-bfe9-a5746c7ade16","year":2023},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:110b79e1aa0e00e99638d76ceaca095f3220bbe5d22a8de3b698e87bdcd1918d","observation_id":"87a025c5-d2a8-4348-9836-ddf276b9acf2","resolution":{"observed_at":"2026-05-11T05:26:06.445032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale.IJCV","venue":null,"work_id":"eb1be0c0-f8e8-4e44-a6e2-f6fcec827875","year":2020},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:7a13c6f1933b54a0955424b3dedbfcc95b270ea650d46b40a268d3b9ff681ec0","observation_id":"c012fa6c-48c5-4d5d-b938-ebd8d6ed12d8","resolution":{"observed_at":"2026-05-11T05:26:06.451376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"6a104fc7-237f-4e7c-a92a-062025b5b303","year":null},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:894f5169aed024399af31ec8de99409cdc91eadf160c3cf7ec58c29273a9b55c","observation_id":"02d3c154-8b2e-4bc1-b46c-4f627f3fe759","resolution":{"observed_at":"2026-05-11T05:26:06.460726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":"2309.06180","doi":"10.18653/v1/2024.emnlp-main.20","metadata_source":"pith","pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","venue":"cs.LG","work_id":"0eb5eca2-2c11-4a77-a25a-18c331a50ed2","year":2023},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:94c7ef4accd87182e42e14e5e9f8cfcf33996ad890610781b8e9c17161d7a8a1","observation_id":"fd045068-0ad5-4337-b55a-975fd7ff9702","resolution":{"observed_at":"2026-05-12T15:03:08.022500Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":"2411.15124","doi":"10.48550/arxiv.2411.15124","metadata_source":"pith","pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","venue":"cs.CL","work_id":"28c9dbea-056a-48c2-8000-85f809827e45","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:005ddea7880871d2e5af3f3075f14542863c60c11e7c9b0a250037939971c971","observation_id":"fe7e3a20-3c4b-4e94-8988-52459e76e5dc","resolution":{"observed_at":"2026-05-11T05:26:05.664367Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T21:53:00.522112+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Echarts: a declarative framework for rapid construction of web-based visualization.Visual Informatics, 2(2):136–146","venue":null,"work_id":"e1bef0bf-d84d-467d-b3c6-d90b398c86e7","year":2018},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:2d838b1c838e383f640d9107bcedd6bab3f35709b615a0cb1d80f783f794de40","observation_id":"7cd21718-a876-4dc6-abd9-b77cb7dd2a94","resolution":{"observed_at":"2026-05-11T05:26:06.465664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2407.07895","doi":"10.48550/arxiv.2407.07895","metadata_source":"pith","pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","venue":"cs.CV","work_id":"746ec475-051a-45ef-a6ed-2de8118466e4","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:a0666effe07fbdf46f804fa3fe58724293c75b78503fdb96746903539be42056","observation_id":"e66a46c0-3c91-4517-ac37-8e63025eff47","resolution":{"observed_at":"2026-05-11T06:01:54.585341Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07981","last_updated":"2025-04-04T14:25:17Z","snapshot_observed_at":"2026-08-07T16:08:52.673312Z","submitted_at":"2025-04-04T14:25:17Z","title":"ScreenSpot-Pro: GUI Grounding for Professional High-Resolution Computer Use","version":1},"cited_work":{"arxiv_id":"2504.07981","doi":"10.48550/arxiv.2504.07981","metadata_source":"arxiv_reference","pith_arxiv_id":"2504.07981","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Screenspot-pro: Gui grounding for professional high-resolution computer use","venue":"ArXiv.org","work_id":"013f64c6-243e-4f27-82e1-75d82d566552","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2504.07981","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:6a21d66c17ac5b2d1662b094bc9930fd5e9e9c87a624d703559f55c8b761cf1e","observation_id":"33b9e398-5f45-423e-92dd-6c3272960c36","resolution":{"observed_at":"2026-05-11T05:26:05.723122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:17.942679+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:17.942679+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T22:40:10.912714Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"29bef5f1-e6a4-4e87-8fbe-118e1444be6f","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:c7a528e1c65814c409b0cf8a80a3f1479bdee34ed14bd0c603105b03ddf557d8","observation_id":"675eeab5-8790-4c16-bf3d-5c39d5151d88","resolution":{"observed_at":"2026-05-11T05:26:06.470167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05510","last_updated":"2025-03-27T17:40:09Z","snapshot_observed_at":"2026-08-10T23:47:22.591447Z","submitted_at":"2025-01-09T19:00:01Z","title":"OVO-Bench: How Far is Your Video-LLMs from Real-World Online Video Understanding?","version":2},"cited_work":{"arxiv_id":"2501.05510","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.05510","snapshot_observed_at":"2026-07-04T03:19:29.950974Z","title":"Ovo-bench: How far is your video-llms from real-world online video understanding?","venue":null,"work_id":"aa3866ff-d08d-457f-be75-99b6b66be18f","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2501.05510","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:37f96ab61d1f15c45d1f2a4e1d1846b3d5addf6119396c110380f25a6180b548","observation_id":"6cccf783-ee74-4d1e-b9d0-eac6fdb1ab84","resolution":{"observed_at":"2026-05-11T05:26:05.803350Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03122","last_updated":"2025-05-21T14:00:20Z","snapshot_observed_at":"2026-08-07T17:28:50.957435Z","submitted_at":"2025-03-05T02:37:41Z","title":"The Devil Is in the Details: Tackling Unimodal Spurious Correlations for Generalizable Multimodal Reward Models","version":4},"cited_work":{"arxiv_id":"2503.03122","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.03122","snapshot_observed_at":"2026-06-29T23:04:01.922362Z","title":"The devil is in the details: Tackling unimodal spurious correlations for generalizable multimodal reward models","venue":null,"work_id":"4c59ed70-6c3f-4611-bc52-89d5f1fca104","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2503.03122","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:a1c189418d074c2c23dbb1212af0458efa4e459a4abc864f68818b1265cdb08b","observation_id":"6d210c9c-db51-4ece-b83e-e8e59d775169","resolution":{"observed_at":"2026-05-11T05:26:05.816865Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03628","last_updated":"2024-11-06T02:50:30Z","snapshot_observed_at":"2026-08-13T03:17:24.896755Z","submitted_at":"2024-11-06T02:50:30Z","title":"StreamingBench: Assessing the Gap for MLLMs to Achieve Streaming Video Understanding","version":1},"cited_work":{"arxiv_id":"2411.03628","doi":"10.48550/arxiv.2411.03628","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.03628","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Streamingbench: Assessing the gap for mllms to achieve streaming video un- derstanding","venue":"arXiv (Cornell University)","work_id":"caec985b-dd2d-4dbb-9199-d147732de99a","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2411.03628","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:2355bd859a93c597b0a284c3487dde02b324b975673cd4c5aed3a8dc3d825d57","observation_id":"a7739048-e734-4807-b2d6-c769a53a1e94","resolution":{"observed_at":"2026-05-11T05:26:05.849502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-14T10:14:18.862721Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":"2310.01889","doi":"10.48550/arxiv.2310.01889","metadata_source":"pith","pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","venue":"cs.CL","work_id":"982498c4-e80e-4e66-8c44-c60813be298d","year":2023},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:53cb9d07dd254f3db3fde2d4de35395c8cb3baf02a0562a41b36105e0a7708c2","observation_id":"c963f759-fa33-4d40-926c-2d7b7c60b7df","resolution":{"observed_at":"2026-05-12T19:28:28.418803Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:24.101224+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:24.101224+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T10:54:50.449643Z","title":"Visual instruction tuning","venue":null,"work_id":"0a395ab5-dfdd-4489-ae3c-594c4431acd9","year":2023},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:4e505f862309183738bad34ec10f1624083b5913ca2c42181a521831977f3a66","observation_id":"e125210c-4fab-4ab3-9c5a-50a03211a77f","resolution":{"observed_at":"2026-05-11T05:26:06.476449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05955","last_updated":"2024-04-09T02:29:39Z","snapshot_observed_at":"2026-08-13T00:34:34.094624Z","submitted_at":"2024-04-09T02:29:39Z","title":"VisualWebBench: How Far Have Multimodal LLMs Evolved in Web Page Understanding and Grounding?","version":1},"cited_work":{"arxiv_id":"2404.05955","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.05955","snapshot_observed_at":"2026-07-08T16:15:06.153368Z","title":"arXiv preprint arXiv:2404.05955 , year=","venue":"cs.CL","work_id":"b65ed183-95d3-4265-a05b-55aa2ec45c7a","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2404.05955","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:0ad2528b6bb761ceb1294bbe2f62d8d48c4be077d764d4ea7136b25d98c2163e","observation_id":"45680f7d-05e7-4bf0-8c52-88abf138915e","resolution":{"observed_at":"2026-05-11T05:26:05.946519Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":"e4e5bddc-6bc7-4372-9dff-3d50b56e3060","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:e8238d8c63cd48519376369919714de15f7f1b30871ecdd2299f972489a85198","observation_id":"40f7a881-bd38-4256-b550-fd9872191a45","resolution":{"observed_at":"2026-05-11T05:26:06.485651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:42:39.717384Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233","venue":null,"work_id":"ae198a2d-888a-4f5e-acec-eaad43d6b025","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:c3354c146c6e2df07210bd5e1a754cb347103846605e40ebdf02fd0b5ca58327","observation_id":"ddb64011-8cbc-4818-b680-416ee764cb66","resolution":{"observed_at":"2026-05-11T05:26:06.493387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00476","last_updated":"2024-06-03T04:13:39Z","snapshot_observed_at":"2026-08-12T14:24:43.915700Z","submitted_at":"2024-03-01T12:02:19Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","version":3},"cited_work":{"arxiv_id":"2403.00476","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.00476","snapshot_observed_at":"2026-07-04T10:29:44.911015Z","title":"TempCompass: Do Video LLMs Really Understand Videos?","venue":"cs.CV","work_id":"88f4d72e-ee93-420a-a61e-64b02b8cc454","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2403.00476","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:d90aee4d6711baa3b0ccf6787192295287f4d4dc4f8305c900baefa1dd9c5ccf","observation_id":"dee4ab59-fd2c-489e-8f14-73b3a8735974","resolution":{"observed_at":"2026-05-17T02:46:17.144047Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:17:26.750635Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models.Science China Information Sciences, 67(12):220102","venue":null,"work_id":"6874ca05-573e-491c-ae2c-269f7ae4bfa6","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:46befba7a29681deeda9bff051ca71e071b2127230e9dc301a814d59dad107ac","observation_id":"7cd549ae-5d9d-4e8e-af05-5d325c973b62","resolution":{"observed_at":"2026-05-11T05:26:06.498097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:918cee6f6edad375f12372918b8da912e4a90be4ac46ee4910aa26f8fa4dc2e9","observation_id":"a34b8a8b-4669-4658-85b2-d5557e30d5d1","resolution":{"observed_at":"2026-05-11T05:26:05.989375Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2501.04686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T20:18:57.513490Z","title":"Ursa: Under- standing and verifying chain-of-thought reasoning in multi- modal mathematics","venue":null,"work_id":"5d081e13-381c-4834-9949-f333b387508f","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:64b54f01e945ce85134677f4e70235d432b189b563ce7e63a71e7c2ee98d080d","observation_id":"5b7c0424-0ad2-48dc-ae2b-ae49ede7034b","resolution":{"observed_at":"2026-05-11T05:26:06.001472Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12832","last_updated":"2024-10-02T17:58:39Z","snapshot_observed_at":"2026-08-12T22:32:17.121578Z","submitted_at":"2024-10-02T17:58:39Z","title":"Generative Reward Models","version":1},"cited_work":{"arxiv_id":"2410.12832","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12832","snapshot_observed_at":"2026-07-08T17:55:20.847513Z","title":"Generative reward models","venue":"cs.LG","work_id":"23ed8cd6-2e8b-4d27-8d71-9e2c7e958e9b","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2410.12832","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:366cdd757dcdd9db9a7b5c2eedd9c7c71b22b5d7907b6b01aad8b27c9fce3a93","observation_id":"4d6b2d37-f2b3-4221-b7d1-cfc6bc8689b0","resolution":{"observed_at":"2026-05-11T05:26:06.009302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Egoschema: A diagnostic benchmark for very long-form video language understanding.Advancesin Neural Information Processing Systems, 36:46212–46244","venue":null,"work_id":"818f4bf6-a3d1-4e8f-8081-b24d55712775","year":2023},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:28bffe1161d2e19247349dbb0056017dc6784b26acfb94de0b4f07bb0220bcc7","observation_id":"fdb0da2f-6ebf-452b-a2f8-a44d1a594cf2","resolution":{"observed_at":"2026-05-11T05:26:06.502713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":"2203.10244","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-07-04T16:39:57.602645Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","venue":"cs.CL","work_id":"8b49b78c-7e1d-4f57-af10-7c11cd63ff7c","year":2022},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:d65ead866f395e025feb3536de8bee1bc1fb24156cdd55c2665dcc46a5f2b493","observation_id":"7ddd73e2-591e-4fce-99f0-8b25006ba738","resolution":{"observed_at":"2026-05-15T21:13:07.396442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T15:02:40.808439Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"4d22ff55-fabf-4856-b0df-6e1300783a01","year":2021},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:f22d0de7241095da787129e08720ce7b21ab37c2e26e598730d4c36cc39dbe71","observation_id":"89a6b06a-1091-4261-a221-92a35397ba27","resolution":{"observed_at":"2026-05-11T05:26:06.507185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Info- graphicvqa","venue":null,"work_id":"dd7b9768-5ce1-410d-a262-82730a2698c0","year":2022},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:3402bc5a49d991323eab821152044aa019478b1d1179a854c1850a95dd467fb6","observation_id":"ba0a29d2-3a8c-4cfd-886f-cf1f7e7539d8","resolution":{"observed_at":"2026-05-11T05:26:06.511470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation","venue":null,"work_id":"e11d3538-9679-40dd-9526-ac9529722198","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:f516faf2ebc8058fe82dfde86d60e9c432f962096d2cfe2f44019913f458a3a7","observation_id":"fe0f7ed6-1c69-4b57-8df3-d082f58edab1","resolution":{"observed_at":"2026-05-11T05:26:06.515776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Modeling context between objects for referring expression understanding","venue":null,"work_id":"bebc80aa-e57b-4727-bd46-63031312959e","year":2016},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:441750973e4988ea9d65f0a90ee9dd3e9af3d126ff51ea0f07f0b1cd46170298","observation_id":"a476d431-18ca-4b33-b46d-eb513dae0cf3","resolution":{"observed_at":"2026-05-11T05:26:06.519936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Memory-efficient pipeline- parallel dnn training","venue":null,"work_id":"092a36c8-679d-4eba-8224-1bba6e72ab71","year":2021},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:3db1b8e359d9f59fe97df569c8774a6a66c166c811727df0475593576ce9f5fa","observation_id":"127ec65b-80c7-4015-9ea1-2867c375c79c","resolution":{"observed_at":"2026-05-11T05:26:06.524415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient large-scale language model training on gpu clusters using megatron-lm","venue":null,"work_id":"92ce8779-1aba-465a-a146-0a7633321f01","year":2021},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:e9d921b16c643fb693813f5c9f87ae19a5ea7c3f9e5dadc6359e4726e2e3e086","observation_id":"4b8b888f-1bae-438a-8669-c29a28dd0630","resolution":{"observed_at":"2026-05-11T05:26:06.528739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":"db03366c-e0c4-49fd-8326-2f49653e2ce2","year":2012},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:5d565f8714a178dba74a4cf35df019a1219a3cd31b1b593d8bf42fbca59ec8d3","observation_id":"59e7d375-3180-4bdb-a701-d888ef651391","resolution":{"observed_at":"2026-05-11T05:26:06.533141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":"aa91df78-9406-4c4b-a769-aba8ccfe78c7","year":2023},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:d1a1df3fcf3ffabb05f3a1686b5c238326456fa880dd15a932a270618c017ce0","observation_id":"9b4338fa-51ad-456e-b352-b7e501089b62","resolution":{"observed_at":"2026-05-11T05:26:06.537573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Addendum to gpt-4o system card: 4o image generation","venue":null,"work_id":"f52a715f-7aee-4c71-b7a6-be37766d9cc7","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:c160a30c3dc1fd055ba86d60d4969829371152b30279c00a645c6ec5d9bd5c4e","observation_id":"1d8d762f-4c4a-457e-8604-ae5f53943323","resolution":{"observed_at":"2026-05-11T05:26:06.541908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Operator","venue":null,"work_id":"35b840b3-ca0f-449f-bd1b-ec778c23f58f","year":2025},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:542e5f0d6bfb56ee015adff8759e2ef3d43ba68e97769a48a0ed34b3290aa169","observation_id":"7b569b03-50fc-4213-9727-1736b58ec368","resolution":{"observed_at":"2026-05-11T05:26:06.545987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:510f3a4a32b55598e26adc3b7ca7e765e0661b791fc14f16aa61773a61ddc9fc","observation_id":"6f2c3e87-a354-4abf-bb94-4c044ab34a4e","resolution":{"observed_at":"2026-05-11T05:26:06.146024Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":"2203.02155","doi":"10.1007/s00354-022-00198-8","metadata_source":"pith","pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training language models to follow instructions with human feedback","venue":"cs.CL","work_id":"52aff42f-4fa9-4fcf-bdb3-1459b9bebf65","year":2022},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:4e60825463ecf40544d00a752599369af13dcd348a895ad844f77c8a1f609328","observation_id":"cccf8905-622b-4a0b-8a49-6fe756b8475e","resolution":{"observed_at":"2026-05-11T05:26:06.156357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04757","last_updated":"2024-01-09T17:34:30Z","snapshot_observed_at":"2026-08-13T04:45:48.084564Z","submitted_at":"2024-01-09T17:34:30Z","title":"How predictable is language model benchmark performance?","version":1},"cited_work":{"arxiv_id":"2401.04757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.04757","snapshot_observed_at":"2026-07-02T12:36:56.159561Z","title":"arXiv preprint arXiv:2401.04757 , year=","venue":null,"work_id":"89af4ea0-249f-4c85-b3a9-6bb49b968ac3","year":2024},"citing_paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-05-11T05:26:04.960844Z"},"links":{"cited_paper":"/paper/2401.04757","citing_paper":"/paper/2505.07062"},"observation_digest":"sha256:2e4041cf436331001dfb8e18da456aa968db5c0b51655504068afc211b50176c","observation_id":"f4f514b0-5bae-4d7b-bb64-ab29ea276fb6","resolution":{"observed_at":"2026-05-11T05:26:06.167444Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.07062","last_updated":"2025-05-11T17:28:30Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T16:13:31.498470Z","submitted_at":"2025-05-11T17:28:30Z","title":"Seed1.5-VL Technical Report"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":1,"verified_exact":51,"verified_fuzzy":45},"total_outbound_references":208},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 100 of 208 outbound references and 100 inbound Pith citation observations for arXiv:2505.07062."}