{"as_of":"2026-08-06T17:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d717bffc4c60e11e9651ac5e07164da4a434c94c9582aa4f66cc48783b589239","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T15:47:49.982564Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T16:13:17.573307Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02735","snapshot_observed_at":"2026-07-31T16:13:17.573307Z","title":"arXiv preprint arXiv:2605.02735 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28154","last_updated":"2026-07-30T12:57:45Z","snapshot_observed_at":"2026-08-03T12:39:00.211104Z","submitted_at":"2026-07-30T12:57:45Z","title":"OPLD: On-Policy Latent Distillation for Multimodal Reasoning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-31T16:13:17.573307Z"},"links":{"cited_paper":"/paper/2605.02735","citing_paper":"/paper/2607.28154"},"observation_digest":"sha256:439b8eaead66a2019c3585ebaf112bdc40f8f7b046c3d7049c042a979cf43f7c","observation_id":"577b9ca7-52c3-4b31-a8f4-fca40918c88f","resolution":{"observed_at":"2026-07-31T16:13:17.573307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.02735/citation-record","integrity":"/paper/2605.02735/integrity","json":"/paper/2605.02735/citation-record.json","paper":"/paper/2605.02735"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:f6fbde3b66a4b95b65ee7d0c572b65e6fea1fc00d87802c183c2f8e3b04fbfb3","observation_id":"3a2c6d5f-8b2d-4508-80e2-23be1da2faab","resolution":{"observed_at":"2026-05-11T16:36:09.579251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T05:19:13.082554+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T09:34:48.459543Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":"19dbc933-eff7-47da-894e-0cb819f498b9","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:00afda29b3a49a677284c156608d050060bd4f04f05539564bf6427426009d82","observation_id":"cc5c100b-b3ca-4721-848f-e2f4db540260","resolution":{"observed_at":"2026-05-26T01:06:25.991467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14231","last_updated":"2025-05-20T11:40:43Z","snapshot_observed_at":"2026-08-06T03:54:12.027415Z","submitted_at":"2025-05-20T11:40:43Z","title":"UniVG-R1: Reasoning Guided Universal Visual Grounding with Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2505.14231","doi":"10.48550/arxiv.2505.14231","metadata_source":"pith","pith_arxiv_id":"2505.14231","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Univg- r1: Reasoning guided universal visual grounding with re- inforcement learning.arXiv preprint arXiv:2505.14231","venue":"cs.CV","work_id":"fad4943c-f29d-4daa-a7ba-dd6f03aac5aa","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2505.14231","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:1d46791297fe041ea8a201ab3f45148c691172d10bbc164a8f0c2b9230e050bf","observation_id":"66037d08-075a-43d3-afba-1f975d3c4ec1","resolution":{"observed_at":"2026-05-11T16:36:09.631193Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sft or rl? an early investigation into training r1-like reasoning large vision-language models","venue":null,"work_id":"b0771cca-30e1-4cea-9736-8612e3b3c58a","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:a683f2e8a64ced9fd096121389757c57758943cb0b64fdab0343f99c912e1977","observation_id":"519fb987-1521-4309-885f-e59d3d4a5cf7","resolution":{"observed_at":"2026-05-26T01:06:25.978226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-02T21:55:15.857183Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":"2403.20330","doi":"10.48550/arxiv.2403.20330","metadata_source":"pith","pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","venue":"cs.CV","work_id":"0d0b977c-a42e-49b1-869e-b7360dca5282","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:a2e3db9ffc8960f7af8f0f52aa6dd372a92e582e472db97c2858e45c6e1a555a","observation_id":"ba3b1d82-cfba-413d-aa70-88101c9f74d8","resolution":{"observed_at":"2026-05-12T19:41:44.612219Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Think with 3d: Geometric imagination grounded spatial reasoning from limited views","venue":null,"work_id":"b2e813ac-f59e-48cd-adc3-d913798f9ce6","year":2026},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:a324b961f8a078794923945296cddf9e3cc1fe8cb2957610271cdb30d26ba72b","observation_id":"529ad48e-7849-43da-8eb9-57d01a694020","resolution":{"observed_at":"2026-05-26T01:06:25.917571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T16:24:02.175554Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"321b2bd4-950a-44f0-ab50-e70251e75187","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:27eb567f041dfceeacd4a12a1d4916aff7a4124de2db590b2a1c4de267c130a1","observation_id":"a6291f43-4fd3-49e4-ab53-0d6edfb426e7","resolution":{"observed_at":"2026-05-26T01:06:25.984613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":"2404.12390","doi":"10.1080/15732479.2026.2630123","metadata_source":"pith","pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","venue":"cs.CV","work_id":"10e71374-f61b-477c-9433-12b7990c388e","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:6b01377d3762abf39520ec8f8449dd370d52139a9bb214b9b6c8bb6ae2557b63","observation_id":"ed1cadea-6207-4b5c-8aa3-40ecee404002","resolution":{"observed_at":"2026-05-15T20:18:15.850579Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T23:51:35.599461Z","title":"Refocus: Visual editing as a chain of thought for structured image understanding","venue":null,"work_id":"fccf4299-b140-4802-a868-310aa5c76a08","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:76d243ed47dde3aeeb994358762b4104cf92df96a579e7edce47ecc6bf2883c0","observation_id":"8f4b7016-b63a-4096-99f4-7ea0ca3e514f","resolution":{"observed_at":"2026-05-26T01:06:25.998588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omni-MATH: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":"4d3584ee-56cb-4c17-9320-0f305171ebf0","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:19dacf305996ad680847a2472f79572da20de9a0c508f8d67cc030151d3c03ed","observation_id":"c7ec3e4d-a5c5-44ff-bfb8-fa94413f0e62","resolution":{"observed_at":"2026-05-26T01:06:25.949019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interleaved-modal chain-of-thought","venue":null,"work_id":"b3444e36-ad02-4c2e-8e6e-7d42183806d3","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:99baee630e49c259b93bbec694ef63a7e044f53a993697568f2877b3a537104c","observation_id":"8c2ee88f-a43e-4f6a-9657-550f5c015b93","resolution":{"observed_at":"2026-05-26T01:06:25.926002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hallusion- bench: An advanced diagnostic suite for entangled language hallucination & visual illusion in large vision-language models","venue":null,"work_id":"05d0040c-d33d-4938-9606-6b52b98cd8bd","year":2023},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:21787185c1f5fbd7b898cc27583876a9e3fd0f1a2a8da5569c4099929599bd44","observation_id":"8733b059-e4b1-4135-a7a5-2a44b73fe9cc","resolution":{"observed_at":"2026-05-26T01:06:25.929162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training large language models to reason in a continuous latent space","venue":null,"work_id":"632ef0ac-9583-4c18-a1b3-255da7640a00","year":null},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:0804985093372caec2e152511f3d30ed28bbf0a1ac5e85009ed426c02af4e55d","observation_id":"2e6e0cbf-20a7-46d9-8a0a-bb77addb9cae","resolution":{"observed_at":"2026-05-26T01:06:25.988336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models.Advances in Neural Information Processing Systems, 37:139348–139379","venue":null,"work_id":"b127bb1c-d2a0-4d07-a4af-63f1cfb68ee3","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:9ca3e79f7209ab0275829d10875b4c7d9d988270823cf01d78d883e5e3e63ec2","observation_id":"7334ff85-fe9c-46cf-b2cb-208cf32169fb","resolution":{"observed_at":"2026-05-26T01:06:25.900376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latent visual reasoning","venue":null,"work_id":"33ca8bc8-0de5-4670-9cc2-a81a046c9cc9","year":2026},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:2e8359b12d0917c315ecadf31d85ba12a91b34d22f959c1b9847174b08a18ff8","observation_id":"f6492854-552e-441c-886a-1a135ae0c3e4","resolution":{"observed_at":"2026-05-26T01:06:25.981224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.12623","last_updated":"2026-04-09T15:39:45Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-14T10:07:45Z","title":"Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space","version":3},"cited_work":{"arxiv_id":"2512.12623","doi":"10.48550/arxiv.2512.12623","metadata_source":"pith","pith_arxiv_id":"2512.12623","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Reasoning Within the Mind: Dynamic Multimodal Interleaving in Latent Space","venue":"cs.CV","work_id":"4fe1a03c-93cb-4535-b329-a37b70c8e3dc","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2512.12623","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:ed2de25052491f9089c282d0fc60afefe3f9c8549d686b41a130d3e3ab061727","observation_id":"89b6da3e-4c93-40b6-9ea1-d17d776ad77d","resolution":{"observed_at":"2026-05-11T16:36:09.585493Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deliberation in latent space via differentiable cache augmentation","venue":null,"work_id":"a3ba53fa-6d8c-4533-af48-6e99827aa5a7","year":null},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:0c3b194b8cb534235dd1b178e64fa23054c61aebb291b4bcb0c4841860a56127","observation_id":"c32a2eec-c6af-4597-af8e-4d48820cc54a","resolution":{"observed_at":"2026-05-26T01:06:25.888577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":"fa9c3f29-8eaf-4b7a-b528-7dc25c524f3f","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:713e12d1cc2ec839f5862df055e02f957c644b8050d33d06e733af7816559427","observation_id":"68ca0288-8ca9-4a17-af42-fc0c5bc3dc2d","resolution":{"observed_at":"2026-05-26T01:06:25.880107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"ca2c433f-5447-47c3-96c9-24f2e7852a92","year":2022},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:db9ee9e5d4f637e4505a086d5015320992203e5d7ba635d0fd97c6ee901aa413","observation_id":"b958fd74-c7a4-425d-8d34-807959c82865","resolution":{"observed_at":"2026-05-26T01:06:25.974192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on latent reasoning.arxiv","venue":null,"work_id":"57d7c21f-06a1-4005-b667-8d2baee347ff","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:e0e103a4e1e24279d2f83cf7e026176a83f6008db8ec194596e9598a78c6648e","observation_id":"68d1ffcb-7056-4b6f-a2bb-f2ef99f2c862","resolution":{"observed_at":"2026-05-26T01:06:25.995586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.02360","last_updated":"2026-05-26T12:26:50Z","snapshot_observed_at":"2026-08-04T00:15:08.705793Z","submitted_at":"2025-11-04T08:28:46Z","title":"LaRe: Latent Refocusing for Multimodal Reasoning","version":4},"cited_work":{"arxiv_id":"2511.02360","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.02360","snapshot_observed_at":"2026-06-28T20:22:37.715477Z","title":"Cocova: Chain of continuous vision- language thought for latent space reasoning","venue":"cs.CV","work_id":"88d40f49-8f78-4627-82ad-06f9f4610821","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2511.02360","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:c497e2bcc76953bd83825c6f827d4f97ecc42aed7a0f9b4e012f15b67d9a4b77","observation_id":"4c330125-d170-4c8c-b72b-e0ff100b5b08","resolution":{"observed_at":"2026-05-27T02:05:07.580934Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Compositional chain-of- thought prompting for large multimodal models","venue":null,"work_id":"6fe32806-5f36-42a7-8b0e-6ef807d56a11","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:6c29324bec621dff54d23eeae411d3749dd285d42378aa195776f28b760fecfc","observation_id":"b4a50e53-5de6-4bc5-885f-d95cabce7c8c","resolution":{"observed_at":"2026-05-26T01:06:25.884686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.19418","last_updated":"2026-08-05T08:06:22Z","snapshot_observed_at":"2026-08-06T15:41:11.022681Z","submitted_at":"2025-11-24T18:55:19Z","title":"Chain-of-Visual-Thought: Teaching VLMs to See and Think Better with Continuous Visual Tokens","version":3},"cited_work":{"arxiv_id":"2511.19418","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.19418","snapshot_observed_at":"2026-08-06T02:01:32.731977Z","title":"Chain-of-visual-thought: Teaching vlms to see and think better with continuous visual tokens","venue":null,"work_id":"76c55114-86cf-4cf0-b444-3806dfe547a0","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2511.19418","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:35dc41c98d7f5ed6499defc0f4766854e532308576e8aa00d83f12f10107fdbc","observation_id":"29a6f4c4-47ec-4893-b174-e1fb73bfccf8","resolution":{"observed_at":"2026-08-06T02:01:32.731977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7951337b-d699-4816-b5e2-cc625aeacb62","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:a3ecb6e6198626105f9532fe1798eb29ac5df60a6cc58ad2b1ee5088e305ffbe","observation_id":"c279abb1-582c-4ea8-a1fa-71ac6c0e3188","resolution":{"observed_at":"2026-05-26T01:06:25.921888Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T23:51:35.620761Z","title":"Codi: Com- pressing chain-of-thought into continuous space via self-distillation","venue":null,"work_id":"1a10cfac-e21f-4603-9bcd-6bd82a9489d4","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:1a27f30cd6342290a21850681a7235649d742d7f4b1ded077be879622cd18f25","observation_id":"7f7ffa2f-596d-483c-9e4e-3a37b04ef130","resolution":{"observed_at":"2026-05-26T01:06:25.913984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Swireasoning: Switch-thinking in latent and explicit for pareto-superior reasoning LLMs","venue":null,"work_id":"91f791ef-f8fc-4974-a313-68904a88b772","year":2026},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:b67ec4aea8a5397c372d8e7da0796678ddc3a903ca2ddbba7315c55ef34a7120","observation_id":"f4718f76-c2a1-4d4d-9cbb-71c311ed7cce","resolution":{"observed_at":"2026-05-26T01:06:25.892022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Think silently, think fast: Dynamic latent compression of llm reasoning chains.Advances in Neural Information Processing Systems","venue":null,"work_id":"30337c6c-b850-4260-8799-cf1bd49d0b73","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:f5334041fa262048b97e8e4b82c93ed55406713aa9bc3b973462092df394cc3d","observation_id":"239432c9-d6be-4f55-b0e5-7af43b159614","resolution":{"observed_at":"2026-05-26T01:06:25.952508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visual position prompt for mllm based visual grounding.IEEE Transactions on Multimedia","venue":null,"work_id":"5f1fa1bb-0f5f-4f72-99b7-2507bbc0cccc","year":2026},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:321a95ede985799282b59f04a55093f6f0641229a2af142cdf119a955d8218ac","observation_id":"df45b34b-7cbc-46f8-9c89-5636f31c0502","resolution":{"observed_at":"2026-05-26T01:06:25.942767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"9fc53378-cb24-43c1-a4c4-254ee8c93507","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:4e61c313894dbbb55f007298876c8ff9317da41dd14125cd53b080730e8d5ef5","observation_id":"eeb952a7-f6e8-4310-a861-0b4fbc97e246","resolution":{"observed_at":"2026-05-26T01:06:25.896455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"MLLM can see? dynamic correction decoding for hallucination mitigation","venue":null,"work_id":"f096ae98-2fb5-40d8-9d8e-ff4c3edc7a7b","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:98d1bbcaae17f35a1285d21810ad9e94d0a464f60c683b6d1f903ca16b1ac780","observation_id":"5283bfd8-3b5b-4718-8c67-41d8414ae3e9","resolution":{"observed_at":"2026-05-26T01:06:25.933325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.21395","doi":"10.48550/arxiv.2511.21395","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Monet: Reasoning in latent visual space beyond images and language","venue":"ArXiv.org","work_id":"ce4ac531-7907-4d8a-afe2-9a0dae21ffa5","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:1dd0ef82de9cc0fc2466a0c38caa0a1eced94f14a1e6d2e296b008b9cf956934","observation_id":"f569092e-9845-4108-8277-7acd9e655a91","resolution":{"observed_at":"2026-05-11T16:36:09.653976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21547","last_updated":"2025-05-24T22:36:15Z","snapshot_observed_at":"2026-07-06T21:31:40.171357Z","submitted_at":"2025-05-24T22:36:15Z","title":"Image Tokens Matter: Mitigating Hallucination in Discrete Tokenizer-based Large Vision-Language Models via Latent Editing","version":1},"cited_work":{"arxiv_id":"2505.21547","doi":"10.48550/arxiv.2505.21547","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21547","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Image tokens matter: Mitigating hallucination in discrete tokenizer-based large vision-language models via latent editing","venue":"ArXiv.org","work_id":"6946dc00-f4df-488f-bf2c-d6ea3e167010","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2505.21547","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:5e901300a2d7ae5855e0d7b0b0d7c7eb906c1bcf930066facbe0475c39bb10d7","observation_id":"12eb500d-62b4-4d9f-aa2d-6fbc85357130","resolution":{"observed_at":"2026-05-11T16:36:09.558238Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":"2503.12605","doi":"10.48550/arxiv.2503.12605","metadata_source":"pith","pith_arxiv_id":"2503.12605","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","venue":"cs.CV","work_id":"a8fbb385-8ed1-4952-9ee8-8d03be2b6821","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2503.12605","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:ee52c12436c4aaa2c772c02e1a34736cf7921bff9ebb2f2df7ee48c4166952b5","observation_id":"4cda328c-e917-4ec3-b5fa-2aeecf482a0d","resolution":{"observed_at":"2026-05-15T17:18:53.866178Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:06:42.595164Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":"a3ac3b4d-8c58-4772-ad55-18e8fb162bd1","year":2022},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:552c9e71e734ffd9f79d1ebd319e9979f3a7b9356da9703ed37f32e28ac67cb8","observation_id":"85060b44-8a35-4beb-a7e4-89efad4d3055","resolution":{"observed_at":"2026-05-26T01:06:25.960259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepscientist: Advancing frontier-pushing scientific findings progressively","venue":null,"work_id":"5cb28282-1c61-41b4-9ff5-7fd0c803784a","year":2026},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:22fff63e1de9c30e499115e9d080c607e41ab94a8e60538acfa997e86c6bd30a","observation_id":"eafd2daa-e09f-407c-8b0e-5ec8fd47dbd8","resolution":{"observed_at":"2026-05-26T01:06:25.963118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mind’s eye of llms: visualization-of-thought elicits spatial reasoning in large language models","venue":null,"work_id":"8de973be-d70b-4856-aa4e-68b84fded901","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:242db02a2406ae59d077d4146e2f31b6c9df6356db99b9e001da7f0ee7b55be1","observation_id":"f4a84c9d-0c51-4dc0-baac-ab8e51beee06","resolution":{"observed_at":"2026-05-26T01:06:25.936641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mini-omni-reasoner: Token-level thinking-in-speaking in large speech models","venue":null,"work_id":"91409554-c2df-4e0c-a93d-7ba118d45c23","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:3064111dc87f26d502ebba0c309f261c8540fc393fa55818ee8d156d45b1fdad","observation_id":"d98ebe88-1f9a-4510-ba6b-49e297132419","resolution":{"observed_at":"2026-05-26T01:06:25.906496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.13366","doi":"10.48550/arxiv.2603.13366","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Thinking in uncertainty: Mitigating hallucinations in mlrms with latent entropy-aware decoding.arXiv preprint arXiv:2603.13366","venue":"arXiv (Cornell University)","work_id":"58cebb04-4928-48e5-8d65-6463878d1f71","year":2026},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:ab578e5b4a208ee79be9471986b243b10e47e34c9d63e6869e5e0c4b055e381c","observation_id":"464b87df-fffc-4add-9810-35f6daf5ca5f","resolution":{"observed_at":"2026-05-11T16:36:09.643792Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R1-onevision: Advancing generalized multimodal reasoning through cross-modal formalization","venue":null,"work_id":"797b20fd-0f88-42fa-84ae-bdfa1bc18dbd","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:1e310761e3b4a309ba124df435636cd0b49cf0a350078eb4a5802c4b91e162ec","observation_id":"d8d1f104-679d-44e3-a497-29f2b09baa2e","resolution":{"observed_at":"2026-05-26T01:06:25.945927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:67eb2d53ee6bfec2ecb8722c40efa3dd0cdad5a8e2296f083c308915cb862e54","observation_id":"9a002af4-fc4d-42c0-aece-bc49f199e477","resolution":{"observed_at":"2026-05-11T16:36:09.544273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Diffusion of thought: Chain-of-thought reasoning in diffusion language models.Advances in Neural Information Processing Systems, 37:105345–105374","venue":null,"work_id":"3bdd7184-384c-4507-b6d1-cedf401f87de","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:2a5686b9e21e5a111c309d26335608f0b99a0313e46366ba17392f77f1c36e2f","observation_id":"6aa3f6b0-6b4b-4750-8c29-d17ec79da595","resolution":{"observed_at":"2026-05-26T01:06:25.968119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T09:34:48.435051Z","title":"A survey on multimodal large language models.National Science Review, 11(12):nwae403","venue":null,"work_id":"811a7fd9-1a17-4b79-aa76-eae69f657966","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:47b440ef8de9dad4ec1eb6013cd5c1e9a1aa1abda00ded6e40bc2456899c4c4d","observation_id":"a8175318-fcaa-4440-94db-57ad8b7afcd5","resolution":{"observed_at":"2026-05-26T01:06:26.002163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.08228","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mm-cot:a benchmark for probing vi- sual chain-of-thought reasoning in multimodal models","venue":null,"work_id":"da80aeaf-ad7d-401e-a4ac-9836bfc77781","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:146528abd196d40e81736bcc568e16c576951f72129199cf96d4c40bf1ff11e5","observation_id":"15e7bcb6-1472-4bf6-9258-728eb6b02d07","resolution":{"observed_at":"2026-05-11T16:36:09.609725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi- modal chain-of-thought reasoning in language models","venue":null,"work_id":"3c11008f-fd3d-480c-beac-1f3824a6f62d","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:2c150029d3d8ee18b621077e5d6beb48c8217abd648d6d27c87025266d713753","observation_id":"41d65bfa-371a-4fec-a898-e8b6bd0e72bb","resolution":{"observed_at":"2026-05-26T01:06:25.910229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Promptcot: Synthesizing olympiad- level problems for mathematical reasoning in large language models","venue":null,"work_id":"1166d739-43c1-4723-a2bb-67353b09e602","year":2025},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:29f1552b126e956fa9013c35ad2e19a6245a24320739f6cd3d08b5003d68ae1f","observation_id":"19905017-6415-4da5-86b3-dd82f0ef7ca5","resolution":{"observed_at":"2026-05-26T01:06:25.955941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13872","last_updated":"2024-05-29T02:24:36Z","snapshot_observed_at":"2026-08-03T12:37:51.928616Z","submitted_at":"2024-05-22T17:56:51Z","title":"Image-of-Thought Prompting for Visual Reasoning Refinement in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":"2405.13872","doi":"10.48550/arxiv.2405.13872","metadata_source":"pith","pith_arxiv_id":"2405.13872","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Image-of- thought prompting for visual reasoning refinement in multimodal large language models","venue":"cs.AI","work_id":"b297e4fe-c03f-49c9-896a-2d505bdf26ce","year":2024},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"cited_paper":"/paper/2405.13872","citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:485536abb2a0c1e26a1d4e9504b448272a8409a7135f4864a48cf3276c75facf","observation_id":"82f72304-2dd1-4caf-b824-de36c125a1ef","resolution":{"observed_at":"2026-05-11T16:36:09.568637Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.25040","doi":"10.48550/arxiv.2603.25040","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Intern-s1-pro: Scientific multimodal foundation model at trillion scale","venue":"arXiv (Cornell University)","work_id":"5328cad1-083e-4346-916e-8d865c99f0ac","year":2026},"citing_paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-09T15:47:49.982564Z"},"links":{"citing_paper":"/paper/2605.02735"},"observation_digest":"sha256:02f39c5adb8bd772236d6b3b28acf0b911a95fc4339cf47fa50e3000b3fc97ed","observation_id":"6c795bb6-3c09-41eb-bc64-b841891ac706","resolution":{"observed_at":"2026-05-11T16:36:09.664141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.02735","last_updated":"2026-05-04T15:36:12Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T15:36:12Z","title":"Visual Latents Know More Than They Say: Unsilencing Latent Reasoning in MLLMs"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":1,"verified_exact":14,"verified_fuzzy":31},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 1 inbound Pith citation observation for arXiv:2605.02735."}