{"as_of":"2026-08-16T23:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c2078e71e68dc81418e351da450dd4b233e0711e20d4fc3ea91b1f2f61f78acc","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:17:33.970322Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.12209/citation-record","integrity":"/paper/2608.12209/integrity","json":"/paper/2608.12209/citation-record.json","paper":"/paper/2608.12209"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-16T00:17:33.494370Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.494370Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:da9b578c77f583825b87f4153759c3cee1c8477bd29cddba40820928c8c24ac7","observation_id":"e27eee67-71f9-4100-8bcb-157b5ef51e24","resolution":{"observed_at":"2026-08-16T00:17:33.494370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-16T00:17:33.499723Z","title":"Qwen3-VL Technical Report, November 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.499723Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:f2792bdbd3e003367992c36c6167813007f63b2bf86edc5ce268557c41e86307","observation_id":"73daf702-45dc-4ba5-9b8c-c00c0f426859","resolution":{"observed_at":"2026-08-16T00:17:33.499723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-16T11:21:33.397874Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-16T00:17:33.503957Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.503957Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:7df551c27cf44c6243cbd68a2950bf660cc880d46ff27b9ec2be94cea059d5ec","observation_id":"581d4fef-c86b-4679-892c-e199b0988514","resolution":{"observed_at":"2026-08-16T00:17:33.503957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-16T00:17:33.508431Z","title":"Visual Instruction Tuning, December 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.508431Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:bf0ae59712b25e5b00a2e6bf67f392394a2ca85ab6040b8bed156a535738e3a0","observation_id":"690036a4-7e49-4628-8a91-54aefacf29ac","resolution":{"observed_at":"2026-08-16T00:17:33.508431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.513081Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.513081Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:e208f0931905de76f52f865316f8ca72e2475190b723d90b9817bf029c18724c","observation_id":"073cf827-4cbb-4837-ab8f-b899bd3e0298","resolution":{"observed_at":"2026-08-16T00:17:33.513081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.517459Z","title":"Visual cot: Advancing multi-modal language models with a comprehensive dataset and benchmark for chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.517459Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:5b51d7a78909d6abe7e2fb8a3bbd54f0f2d064099ee5a90cdb94eb35812e271d","observation_id":"66e1153a-e3fe-4ab7-a84d-c0a1ec0e8aba","resolution":{"observed_at":"2026-08-16T00:17:33.517459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.522320Z","title":"An empirical anal- ysis on spatial reasoning capabilities of large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.522320Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:c9667398f4359fc7ca78b54bbed29e80f9e48cc81a2c603a2a4f4021d5f3b6af","observation_id":"48223edc-b902-4f01-9d60-bb73da0595d2","resolution":{"observed_at":"2026-08-16T00:17:33.522320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.532490Z","title":"Why are visually-grounded language models bad at image classification? Advances in Neural Information Processing Systems, 37:51727–51753, 2024","venue":null,"work_id":"cf5b83f0-8b11-4e86-bf76-dcb751e2ea22","year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.526218Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:9b904d2db25aa5025b0716593b8cab2cd7067ace1b0fb706e2d1e8e1c3f215a5","observation_id":"9dcd2796-7c6f-470c-b83f-a84dce81d3b9","resolution":{"observed_at":"2026-08-16T00:17:35.537516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.516720Z","title":"Question aware vision transformer for multimodal reasoning","venue":null,"work_id":"e1f75f44-0ecb-4c7a-a4cf-87726d8120fc","year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.529994Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:52bd1baa8d9d0da67a9e9887c46952ac6068b6354f78d164b10d0967abd7ad5e","observation_id":"56769107-c26a-4d69-8ea9-0a62b49efece","resolution":{"observed_at":"2026-08-16T00:17:35.521970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-16T00:17:33.534077Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.534077Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:594013928baddade0d39a13e62142ebf5a7a1454718731a2b972b58addacbd1e","observation_id":"d29ae9be-8ff3-4050-9b9a-60a890622529","resolution":{"observed_at":"2026-08-16T00:17:33.534077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.500596Z","title":"Show-o: One single transformer to unify multimodal understanding and generation","venue":null,"work_id":"561a08ea-3ab8-471d-b016-2664f397d8dd","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.539092Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:cf2e338f77dab979a6fa14f4643325feedee731861f93d74f9f4d5f7a2b0ad84","observation_id":"8111b51c-97ea-491e-bf8a-5ac7e5ac0c30","resolution":{"observed_at":"2026-08-16T00:17:35.505930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.485062Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model","venue":null,"work_id":"1819d2f6-3fb8-4501-b41b-e384cbe0dbe8","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.544262Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:28ac5608201ce8c7e4a26a470e7e8f55361dbaa890083ae9eaa13088d03d2af9","observation_id":"1b064072-c6b8-46a6-a37c-2e788fcd5d72","resolution":{"observed_at":"2026-08-16T00:17:35.490249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-08-16T02:50:09.905402Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-16T00:17:33.553581Z","title":"Emerging properties in unified multimodal pretraining","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.553581Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:029c0e6d7b5180f6d928422323c17149160faa6e9656d27660c2a13a7e7797ea","observation_id":"5357a682-5d79-41d5-9b67-aa6be7d681e1","resolution":{"observed_at":"2026-08-16T00:17:33.553581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.558435Z","title":"Mammothmoda2: A unified ar-diffusion framework for multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.558435Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:b1199ecbdc6c7e4d2e881eff2aa5b4b7fc0574ccf9661ea1936411572430ce55","observation_id":"3f0b369f-d2e4-4afc-9563-01b08ee21b37","resolution":{"observed_at":"2026-08-16T00:17:33.558435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18678","last_updated":"2026-05-20T11:14:23Z","snapshot_observed_at":"2026-08-16T10:04:17.107660Z","submitted_at":"2026-05-18T17:18:24Z","title":"Lance: Unified Multimodal Modeling by Multi-Task Synergy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18678","snapshot_observed_at":"2026-08-16T00:17:33.562911Z","title":"Lance: Unified multimodal modeling by multi-task synergy","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.562911Z"},"links":{"cited_paper":"/paper/2605.18678","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:8fd2af3396a39e0c74577e51f708bd494e2e75121fdd39def87d6c01ffa8b023","observation_id":"569f7263-26fc-45b3-8025-46d8129b94ac","resolution":{"observed_at":"2026-08-16T00:17:33.562911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.567839Z","title":"Multimodal learning with next-token prediction for large multimodal models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.567839Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:fb6bf9b0f2884d1ad8a44a4af2196d4f0620027c00786387de13ed37f41cf883","observation_id":"63003f27-2aa1-4654-9c49-363a64cad2c1","resolution":{"observed_at":"2026-08-16T00:17:33.567839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.572476Z","title":"Janus: Decoupling visual encoding for unified multimodal understanding and generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.572476Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:9cb17dbc205aa1e732126ea10c391497bc383e5047571c19c0cd187e11652a45","observation_id":"84770594-92dd-4d11-8867-6f6eccdd453c","resolution":{"observed_at":"2026-08-16T00:17:33.572476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.442240Z","title":"Mmada: Multimodal large diffusion language models","venue":null,"work_id":"2d84f799-a774-4986-8499-5a2ba6a7d45f","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.577175Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:cf6fb5c3457e2371ea525da359240be52aa76670adc4f15bcc0db6d9d1c2ea08","observation_id":"5da4b6b3-7fb0-4f5a-befe-3a99babd2c83","resolution":{"observed_at":"2026-08-16T00:17:35.447949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.581554Z","title":"Longcat-next: Lexicalizing modalities as discrete tokens","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.581554Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:93517f8d246a91d8274e22e34088cd35b4f499b75f7ce54686d64caf9ed95b51","observation_id":"75ccea02-af2c-4f5b-a6b5-5904a0f2c0b2","resolution":{"observed_at":"2026-08-16T00:17:33.581554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.585968Z","title":"Next-embedding prediction makes strong vision learners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.585968Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:0cc1049b032f72d2f8d06ad0414f530c37bbb29034ef9c210fdb136a6cb7a211","observation_id":"64c0448f-797f-402e-b382-d4c47a23a458","resolution":{"observed_at":"2026-08-16T00:17:33.585968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.590538Z","title":"Unihetero: Could generation enhance understanding for vision-language-model at large data scale? arXiv preprint arXiv:2512.23512, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.590538Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:5df35cfeeccd7bda2977b0f3cc67295d0256c6da8eef0ae0e17e54433744311a","observation_id":"37c21e1c-d592-4b6d-ab4d-9da81a50ac3f","resolution":{"observed_at":"2026-08-16T00:17:33.590538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17202","last_updated":"2025-06-20T17:52:31Z","snapshot_observed_at":"2026-08-15T19:07:33.152948Z","submitted_at":"2025-06-20T17:52:31Z","title":"UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2506.17202","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.17202","snapshot_observed_at":"2026-08-16T00:17:34.441930Z","title":"UniFork: Exploring Modality Alignment for Unified Multimodal Understanding and Generation","venue":"cs.CV","work_id":"566bea5b-418a-473f-9d62-0d3370607e76","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.594876Z"},"links":{"cited_paper":"/paper/2506.17202","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:fb307c40b9bec51049b0f74e89aa2ac169d4cccef90298a62aa347070f9a25d9","observation_id":"942b4361-6ee5-44ce-ba8e-a87358e57908","resolution":{"observed_at":"2026-08-16T00:17:34.447253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.599748Z","title":"Uni-x: Mitigating modality conflict with a two-end-separated architecture for unified multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.599748Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:bd1a3b5f553fd90f994e4f656d714e85b2c525483611cbf1d6f61f1c87512607","observation_id":"0c30f67c-517b-4927-81ba-45a7ce43b7b8","resolution":{"observed_at":"2026-08-16T00:17:33.599748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.426326Z","title":"Mixture-of-transformers: A sparse and scalable architecture for multi-modal foundation models","venue":null,"work_id":"55c9b6b3-76a0-411b-ad97-fb99ae1a33d7","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.604319Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:b87932706d59ef410e7a7e5bf65b0307445a704967a2ebe1916ec5a9926d79ee","observation_id":"6985abff-97f7-4ef9-9bb6-0f31241ac41d","resolution":{"observed_at":"2026-08-16T00:17:35.431635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-16T00:17:33.608967Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.608967Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:9beadef04eb8b1951747b9dfb472dbd301579227d75fdac3f0714a08a7cb82dc","observation_id":"1dfc456c-42b0-4591-ae33-cf1c8703e850","resolution":{"observed_at":"2026-08-16T00:17:33.608967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-16T00:17:33.613869Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.613869Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:8668f6c5154091feb413ee2a92fad649806b9fd8ff19e6c921fc95c9e47927eb","observation_id":"7ef9f9ac-56f1-4129-9351-ddfa7291dc70","resolution":{"observed_at":"2026-08-16T00:17:33.613869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.410411Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":"f5a6ff53-ed43-452e-b573-4392bfdc0d22","year":2020},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.618475Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:203932e6a9ae72e8e3f38e1300fc2a6702ec1b80db760f24d97f6c6069c1c40c","observation_id":"d32e69c6-17cd-44c4-abf9-8a2e7f63c81b","resolution":{"observed_at":"2026-08-16T00:17:35.415500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.394585Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":"d22ad165-49a8-4bc1-9d2c-930e0640f4ae","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.622968Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:257a519b3b555faf08b4fd46b96ebc9d169eaf6b0b1c70e81105954fac847fb4","observation_id":"41ae2848-0ec8-47b1-90a8-5f6a04382004","resolution":{"observed_at":"2026-08-16T00:17:35.399745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.378942Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"617243a9-9146-4f19-8583-af752a35aa76","year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.627474Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:ef89202b2c9539841c7086b83864afc30a9d2daaddaa7309e78c2b6ae8622bf1","observation_id":"183cc7c9-3aab-49f4-9be4-b059d9ce5cfd","resolution":{"observed_at":"2026-08-16T00:17:35.384039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.632306Z","title":"Blink: Multimodal large language models can see but not perceive","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.632306Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:1a1a0b386b0fe4dece71ec823b5905badfd35b5b7a3c63cb736bd8fda5284f81","observation_id":"f66b54ef-2f8e-4fa1-b366-dae59ce38d49","resolution":{"observed_at":"2026-08-16T00:17:33.632306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.636732Z","title":"Charxiv: Charting gaps in realistic chart understanding in multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.636732Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:a0254a1424104a98dc1593781caaffffe5be6665f02b18d8f7b899a81be8e368","observation_id":"d1930387-009c-43db-90c4-b86a88be5003","resolution":{"observed_at":"2026-08-16T00:17:33.636732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.641183Z","title":"Dynamath: A dynamic visual benchmark for evaluating mathematical reasoning robustness of vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.641183Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:098d680b79060ee9fae50a0217e9e8aa7e822cf5d7f0f99f3263db942135934a","observation_id":"39e60b28-eb04-4718-9a89-3abff8768d58","resolution":{"observed_at":"2026-08-16T00:17:33.641183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.645477Z","title":"Measuring multimodal mathematical reasoning with math-vision dataset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.645477Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:55c4ce2de629e49b9736f024f4adb62ee9589c20823e659d87e0d5d252c0967f","observation_id":"a74c4a37-3aca-4d5d-94d0-28c8a50ffbdb","resolution":{"observed_at":"2026-08-16T00:17:33.645477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.322033Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":"7d2d9611-bdfd-4e8e-9528-67b10cb8f958","year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.650019Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:f6f152299b270a9b365c308447eedfe7ff245f34b07e23718bfd693a2e466578","observation_id":"320d399e-1b4b-4016-ac2b-82b8f1efb5be","resolution":{"observed_at":"2026-08-16T00:17:35.326990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-16T00:17:33.654244Z","title":"Logicvista: Multimodal llm logical reasoning benchmark in visual contexts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.654244Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:2ecacfe571e7ce2c8f581542e8f2bdda75a9e15511f0b6f3784d1d0f2e3402b3","observation_id":"f06d5710-f9c5-4b5f-a98d-e20707970c57","resolution":{"observed_at":"2026-08-16T00:17:33.654244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.306885Z","title":"Visulogic: A benchmark for evalu- ating visual reasoning in multi-modal large language models","venue":null,"work_id":"f08aedf5-2123-490d-9d48-39c92d7cbad1","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.658494Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:f4b41fcc870d1f3b6870e2279a73859c046d895c4011a9e65eac95a6bdefcc00","observation_id":"02f09eb4-7996-4dfb-af6e-2b535747e291","resolution":{"observed_at":"2026-08-16T00:17:35.311942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12066","last_updated":"2023-02-23T14:43:53Z","snapshot_observed_at":"2026-08-16T15:53:14.227490Z","submitted_at":"2023-02-23T14:43:53Z","title":"Teaching CLIP to Count to Ten","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12066","snapshot_observed_at":"2026-08-16T00:17:33.662073Z","title":"Teaching CLIP to Count to Ten","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.662073Z"},"links":{"cited_paper":"/paper/2302.12066","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:5cd589c0565453f38569373f5ed949d3046922dfe7e65616221189456da5554f","observation_id":"26c84fe8-d53e-442a-a4e8-85a94ad09106","resolution":{"observed_at":"2026-08-16T00:17:33.662073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-16T00:17:33.665902Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.665902Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:6f8a793a3c8d54596e2cd0931bb60a1a27d5d0df4edd6b86d2e15331330053be","observation_id":"1804ee86-6b67-4b94-947f-7787318f7452","resolution":{"observed_at":"2026-08-16T00:17:33.665902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.291246Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":"7979c4e0-53a6-455e-af8d-01ba4e9b211a","year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.670137Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:09e746c4824fc177045005f70aad855c36f4174800b000b227c68b4a44d41a02","observation_id":"def81ece-2147-47a0-bae5-2907a8f1f1a4","resolution":{"observed_at":"2026-08-16T00:17:35.296526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.275089Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"2ae8816f-0c24-4488-9d71-6f71a2dbec19","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.674031Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:bcfa54deb5d8e66ee2218fbd672ebef92abae99fd2fedaa0acf03b6f6991ee64","observation_id":"40f3269a-697b-44c9-a810-275fa14c1ae3","resolution":{"observed_at":"2026-08-16T00:17:35.280336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.677995Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.677995Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:fe019dcb954b14e3b870989b444749d5222013570bf55b653879bad842085759","observation_id":"314f5c6e-7cb5-418f-b2df-3c51bcb1741d","resolution":{"observed_at":"2026-08-16T00:17:33.677995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15279","last_updated":"2025-04-21T17:59:53Z","snapshot_observed_at":"2026-08-16T11:26:50.664277Z","submitted_at":"2025-04-21T17:59:53Z","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15279","snapshot_observed_at":"2026-08-16T00:17:33.682022Z","title":"Visulogic: A benchmark for evaluating visual reasoning in multi-modal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.682022Z"},"links":{"cited_paper":"/paper/2504.15279","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:b89ec24732b8ef4d3cbdbd68d8abb71bd453687c72548ae382db01b68e1a76b0","observation_id":"2cbd7d36-a227-4539-97e0-6a8033974b9a","resolution":{"observed_at":"2026-08-16T00:17:33.682022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.249628Z","title":"Thyme: Think beyond images","venue":null,"work_id":"bc8bff89-c377-46ae-9bf9-92aa27f4508d","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.686813Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:2079c137a2babe30b54684f5c32c54fd27674bd39529f012dcc158413c80c06e","observation_id":"cd0019bf-cc06-4fde-a865-57ac6f7ea711","resolution":{"observed_at":"2026-08-16T00:17:35.254442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.691642Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.691642Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:799a361ba901f08105511885207b92547286740c286b2f9be17b4d90192a4605","observation_id":"523eabbf-f825-472c-b160-5d5f89a617c0","resolution":{"observed_at":"2026-08-16T00:17:33.691642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.223752Z","title":"Qwen2.5-VL Technical Report, February 2025","venue":null,"work_id":"c8c99bbb-3749-40eb-b6ec-085790d7b0ad","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.695959Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:7dea8580454303bb9153b0ee52aca8de373c9f83dbbd7dd5e609dc04faaedfc3","observation_id":"83854f49-131d-44c5-bbf6-29f72bce05df","resolution":{"observed_at":"2026-08-16T00:17:35.229128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.207686Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning","venue":null,"work_id":"85681e59-bc78-4334-abf9-fd2928e6e145","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.700366Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:3ee7d1dc51811e73e17b2ae686af15406b72355c1e2eb860cfabd691d876de08","observation_id":"e64aa5f8-a4cc-45e2-8d69-c4de94a0fee5","resolution":{"observed_at":"2026-08-16T00:17:35.212857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-16T00:17:33.704691Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.704691Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:db0ee9bb41305924e55dc344614e83e27274a4bf9ae0836c42f5eb8713fb68c1","observation_id":"6a154796-6cdf-4c11-a87a-e2d00e90aabb","resolution":{"observed_at":"2026-08-16T00:17:33.704691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.191700Z","title":"Show-o2: Improved native unified multimodal models","venue":null,"work_id":"a164bf39-c05e-4276-83f4-aa4404fd52b6","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.709277Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:3dc33dcea035f94ff72317ffe54f73fb2475a4389e3cd9995232536254f63fe6","observation_id":"c858fa4b-9750-475f-82ff-832482d94d18","resolution":{"observed_at":"2026-08-16T00:17:35.196673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.713410Z","title":"Cheers: Decoupling patch details from semantic representations enables unified multimodal comprehension and generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.713410Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:023ddac5c18cfe823dbdb685cc61b57499138c1667401e79d2472382a27ff59a","observation_id":"afd85e1c-5dd4-4d8f-8ef3-6c2d91e10f02","resolution":{"observed_at":"2026-08-16T00:17:33.713410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.718062Z","title":"Coyo-700m: Image-text pair dataset.https://github.com/kakaobrain/coyo-dataset, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.718062Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:08744d5a6f64189123ab8e56b4374a1425fabad67e9fb6505163b74eca905328","observation_id":"50dfeed4-2f57-42eb-a738-4a3adbb969c6","resolution":{"observed_at":"2026-08-16T00:17:33.718062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.722979Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.722979Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:45d5c243e4a71ce5f1cea06de78e9c82616e6278bf351cdcd9bb25112d32114b","observation_id":"48670c1e-7796-4337-84f5-53a46388c1c1","resolution":{"observed_at":"2026-08-16T00:17:33.722979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.156478Z","title":"Gen- eration and comprehension of unambiguous object descriptions","venue":null,"work_id":"7315f74a-2231-48c2-93b1-da05c7736f4f","year":2016},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.727985Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:59ed896d962bb2c826340bb72ae9a6e65876faa6d567be5b5bab4db4e7cebd82","observation_id":"5ecf47df-c7d9-4053-b9f6-444cd7a69bcc","resolution":{"observed_at":"2026-08-16T00:17:35.161417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.140495Z","title":"Referitgame: Referring to objects 23 in photographs of natural scenes","venue":null,"work_id":"8e262f84-ecfd-4ee5-ab1d-f8f308fcc4c4","year":2014},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.732783Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:87799b779434c47c8f51ab6c1db3e1c04187439b98ca23cd206cbe1906f95214","observation_id":"3091c69c-ee9c-4e96-a108-d3f6d8b20ad8","resolution":{"observed_at":"2026-08-16T00:17:35.145538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01100","last_updated":"2025-07-15T01:14:25Z","snapshot_observed_at":"2026-08-15T18:38:02.815401Z","submitted_at":"2025-02-03T06:44:49Z","title":"ZebraLogic: On the Scaling Limits of LLMs for Logical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01100","snapshot_observed_at":"2026-08-16T00:17:33.737344Z","title":"Zebralogic: On the scaling limits of llms for logical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.737344Z"},"links":{"cited_paper":"/paper/2502.01100","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:3809022d13ba78099d6f1c9bd131e7ed09225dce52aaec7a9de49df05abed8fb","observation_id":"26584f7a-e5c5-430d-8e1e-9bb1d93aa0af","resolution":{"observed_at":"2026-08-16T00:17:33.737344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.742241Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.742241Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:9d93fac51a95c0c271575d309dd1fa016b3a8fcec27a36d9ac86c2fc3e370a97","observation_id":"c70cbff7-5db0-4c6d-b223-3480478740f4","resolution":{"observed_at":"2026-08-16T00:17:33.742241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:33.747386Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.747386Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:67010385975ec855531d370ae6203050ef97cdbbac8427486fe364fc6fd9d3d2","observation_id":"905e03c1-049e-4f64-a7bc-241d4ddf8505","resolution":{"observed_at":"2026-08-16T00:17:33.747386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.107723Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"9ab8fb0c-4a58-406e-b0bf-058c18478407","year":2023},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.752571Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:b2b1fb1f183721a598e86e2b9bdb2b88bc2e3e0d57ea36f09c0cc09e789d10b5","observation_id":"9268cac0-a2b7-4868-b137-d12d81434bcb","resolution":{"observed_at":"2026-08-16T00:17:35.111944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-16T00:17:33.758009Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.758009Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:f73d4ef580d2064115983927581486e6aa1acb81c9d7933f5f10d705c3451e76","observation_id":"84d506e9-63f8-4616-8f32-61a9a384bdfe","resolution":{"observed_at":"2026-08-16T00:17:33.758009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-16T00:17:33.762555Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.762555Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:ca4971e4741c857127ee536ba011ff74efb9d1bb46ef4c3fd37f9c7c68cc4dd6","observation_id":"806d6f5a-3a59-438d-b1ec-c1e99e70adca","resolution":{"observed_at":"2026-08-16T00:17:33.762555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.092480Z","title":"gpt-5-system-card, 2025","venue":null,"work_id":"7d7bbb6e-d474-423c-aac9-2d97a1496143","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.767368Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:51fa6f4e2ca8d4f6cccda9cf3737ffe494676b60ffd656a8674069f032ec81f1","observation_id":"bd887cbb-d5da-4d59-9661-9de455213db5","resolution":{"observed_at":"2026-08-16T00:17:35.097932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.077368Z","title":"URL https://blog","venue":null,"work_id":"627a2bed-409e-46d9-94d6-eefebbe9a863","year":2024},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.771718Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:6bfd585c10db787c43cb7b05f19e7a4e4d97c848fadf4fc9231dcf1e2346979a","observation_id":"aacebb07-2ed8-446c-91cb-8ecf55737892","resolution":{"observed_at":"2026-08-16T00:17:35.082321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.062886Z","title":"Gemini 3 flash: frontier intelligence built for speed, 2025","venue":null,"work_id":"2e4604bb-0daa-4818-92dd-e546bebf6224","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.776922Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:3590dbee8d60ff9c2251ff9750023cf979d0ab2d1fe84f3791b2dfce0a616c93","observation_id":"53b7ce97-9450-476f-be32-e5a9b92933bf","resolution":{"observed_at":"2026-08-16T00:17:35.067638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.046614Z","title":"VGR: Visual grounded reasoning","venue":null,"work_id":"669efc22-07cb-4ce9-b068-3ac5816b1110","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.781312Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:9adb1181d195a9ab70177ff2c3872aabaff7a9152e5e049144a6e69e9e6d6595","observation_id":"fd929ecf-1804-4e14-a388-44982ba0013b","resolution":{"observed_at":"2026-08-16T00:17:35.052990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.17298","last_updated":"2026-07-08T05:23:56Z","snapshot_observed_at":"2026-08-16T21:39:42.542212Z","submitted_at":"2025-08-24T11:01:51Z","title":"Explain Before You Answer: A Survey on Compositional Visual Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17298","snapshot_observed_at":"2026-08-16T00:17:33.785540Z","title":"Explain before you answer: A survey on compositional visual reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.785540Z"},"links":{"cited_paper":"/paper/2508.17298","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:0f77a044129f4a73960b4495fb2eb8b4da175f6f442fb04d0bd889312e7686c0","observation_id":"e58da99f-15e6-4f75-ae40-28dbe6609a75","resolution":{"observed_at":"2026-08-16T00:17:33.785540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18478","last_updated":"2025-04-27T10:39:51Z","snapshot_observed_at":"2026-08-16T12:47:26.715094Z","submitted_at":"2025-03-24T09:21:48Z","title":"Video-XL-Pro: Reconstructive Token Compression for Extremely Long Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18478","snapshot_observed_at":"2026-08-16T00:17:33.789852Z","title":"Video-xl-pro: Reconstructive token compression for extremely long video understanding, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.789852Z"},"links":{"cited_paper":"/paper/2503.18478","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:28c763e926be74b7a052a7f7a7867b5aa78ff0692d4cc89a17fcfa28ce17f49a","observation_id":"8f707088-def0-4a1a-9541-a31fde45abf9","resolution":{"observed_at":"2026-08-16T00:17:33.789852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.030932Z","title":"Video-xl: Extra-long vision language model for hour-scale video understanding","venue":null,"work_id":"4111057c-f65a-4868-95bc-004438917df0","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.892662Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:c2f575967ba098142c24e876aa6abfa808af491796598b3840c87f463cdaeb41","observation_id":"ac6385c7-46e4-4ff2-ae91-b502cbe09e08","resolution":{"observed_at":"2026-08-16T00:17:35.036455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.015630Z","title":"Videochat-flash: Hierarchical compression for long-context video modeling","venue":null,"work_id":"2a5bf34a-b20a-4740-9864-218ff6140158","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.897426Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:030646f7875747921561df50f38e1c4c50eadd70560697a11456685f99137c7a","observation_id":"a929b0c3-f6b3-4cd3-b19b-0091995455d4","resolution":{"observed_at":"2026-08-16T00:17:35.020711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.999753Z","title":"Reconstructive visual instruction tuning","venue":null,"work_id":"fc545ca4-e0e4-465b-82bf-f12fa5082a34","year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.902010Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:9ecf5767e7e6e3870e535e49fcd3a53db28ec9334cc71ffdea628b37031f9f0d","observation_id":"a4a286f7-2de5-4dce-8344-2dd178faa383","resolution":{"observed_at":"2026-08-16T00:17:35.004875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.984824Z","title":"Autoregressive semantic visual reconstruction helps vlms understand better","venue":null,"work_id":"3dd6b114-d879-4f58-a54b-318a8bedbbdf","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.906676Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:f93838104f3a42275f51fd99c99e82f084c88597fd7061cbd3087372da43c0af","observation_id":"e779dc83-cfa0-4390-b4fb-f2934a771cda","resolution":{"observed_at":"2026-08-16T00:17:34.989707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.970510Z","title":"Generation enhances understanding in unified multimodal models via multi-representation generation","venue":null,"work_id":"2fb5bbe2-b076-41d2-acce-d9c76301f682","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.911508Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:604ff4bd3bbb79b79407603f5cf30c9c9d02db3036f0965daf065783178d8f59","observation_id":"0dae9be8-18b4-462f-aedf-d247e85fa217","resolution":{"observed_at":"2026-08-16T00:17:34.975035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-08-16T09:34:56.272667Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-16T00:17:33.916989Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.916989Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:bbacce98aefdc07c72372640052fd5e984c8629f884ee5241913e26166aaebaf","observation_id":"b8ab97a0-4659-420f-bbd2-40479f921270","resolution":{"observed_at":"2026-08-16T00:17:33.916989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"3876.9246","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.075919Z","title":"LMFusion: Adapting pretrained language models for multimodal generation","venue":null,"work_id":"ffe4cd15-3f9f-47b9-91f9-8d280c97241c","year":2026},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.921910Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:f3a62495a0db6c5ddb07fcf9b9038f716ad3939779e946447816af12572dcb2b","observation_id":"f820c2a0-3031-4f0e-87b8-b377bd0734ae","resolution":{"observed_at":"2026-08-16T00:17:34.087176Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.956552Z","title":"- Row 1, Fig","venue":null,"work_id":"2b1b9797-afa7-4fce-9771-535514d56257","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.926801Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:fbaadf39dd35aea46b8395d05d3f9f47888ba29ce8374c376f4bd6f729eb3467","observation_id":"95c572ab-905d-4dd6-bc6f-629fc15d2719","resolution":{"observed_at":"2026-08-16T00:17:34.960789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.942038Z","title":"All figures share the same two-shape overlapping composition with consistent contour and inner-line connectivity","venue":null,"work_id":"2cfffba8-72ac-4da5-bf3e-7fe8c4a644bc","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.931751Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:f550a2342bcc48c45af0d41459fd0703877cdf3f182535a6845b32345961f822","observation_id":"3b16e616-1bc7-4869-aa16-07fc00ab01c8","resolution":{"observed_at":"2026-08-16T00:17:34.947379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.926578Z","title":"Option A is a triangle pair with a mismatched shape; Option B is a triangle pair with inconsistent line count; Option C is a quadrilateral but with a different stacking style","venue":null,"work_id":"7f9b096a-ed5f-47fe-966f-9f91d511e519","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.935730Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:bbcfb96fadfef25c8645ab45c06beba32beea7a5986c2858c898b34d15429dbb","observation_id":"2c55ad56-d9a3-48ba-9d36-a7298d51ff94","resolution":{"observed_at":"2026-08-16T00:17:34.931691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.910726Z","title":"A bipartite graph is a graph whose vertices can be divided into two disjoint sets such that every edge connects a vertex in one set to a vertex in the other set","venue":null,"work_id":"41f215e3-4eca-45e2-b096-9fd69c65e04f","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.940312Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:a97ac08febdedb9f104f5ea2ba51a37c04ee927d82fc78c0661d3a04241fc3ca","observation_id":"64359b35-023e-4c33-8ad6-d23ce8ab9a83","resolution":{"observed_at":"2026-08-16T00:17:34.915799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.894496Z","title":"If there are no odd-length cycles, the graph is bipartite","venue":null,"work_id":"6741f625-5e43-4546-852f-30279d0fc161","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.946065Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:edbec487bafba99a112d63847a62fbf1890a7f3d7d897105b99a1d87f85d72ba","observation_id":"ace91903-90da-48b4-8a18-a0dfcaaadbf3","resolution":{"observed_at":"2026-08-16T00:17:34.899750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.877979Z","title":"This is because we can color one set of vertices with one color and the other set with a different color, ensuring that no two adjacent vertices share the same color","venue":null,"work_id":"6a35008b-1940-488d-9199-d9d3ad36940c","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.950502Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:ac5f39df689c2779b1c0b1784ee0e9223059d737d9fbe038cb459c426ba92434","observation_id":"fed92e39-9f71-4eb9-b408-a516c7389120","resolution":{"observed_at":"2026-08-16T00:17:34.883082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.862004Z","title":"</think> The final answer is2","venue":null,"work_id":"16ceb705-eed5-411d-bad2-f3c77e7a75c1","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.955074Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:700d21848027ecd95c267390307c147a177ab21c616ec32f929ef0fe211c154c","observation_id":"7a933e72-25a3-440a-84da-7f5ef6be6931","resolution":{"observed_at":"2026-08-16T00:17:34.866845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.845554Z","title":"There are two visible wooden poles supporting the tree","venue":null,"work_id":"08aa839a-bb7d-4d1b-b605-686d3c971586","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.959994Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:f1648c886bbc8d763073f4f82eb01a38a20ef467fe255202f462d18a40aabccc","observation_id":"1cb9d5ad-aa2a-48ce-adbc-690eaec86790","resolution":{"observed_at":"2026-08-16T00:17:34.850621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.828103Z","title":"There are no additional wooden poles visible in the background or elsewhere in the image","venue":null,"work_id":"6e846591-c925-4e1e-9e6e-8ac1b02a1e92","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.964690Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:f57684377f7828495d4b05f19b463e152b91a94f77b950719f9707040fc57b53","observation_id":"349c59f0-13ea-4c7c-ab7d-5e1d5209b7af","resolution":{"observed_at":"2026-08-16T00:17:34.833597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:34.813021Z","title":"Given this analysis, the correct answer is: **C","venue":null,"work_id":"46cd641b-66db-49b1-98ff-cb857b86fea4","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.970322Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:a0969e3938313d0fb4dbe2e859ad154261500a72cfc298c24168c53c8fccb10e","observation_id":"efe688c9-dee5-47cf-8bef-abf21d9a764e","resolution":{"observed_at":"2026-08-16T00:17:34.817360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:17:35.469379Z","title":null,"venue":null,"work_id":"afc8146e-6f4d-4e20-aed8-c6590eb83b5f","year":null},"citing_paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-16T00:17:33.548992Z"},"links":{"citing_paper":"/paper/2608.12209"},"observation_digest":"sha256:01a47471355aa3523cce81d12c2141436dfc03d42710835e4d1526e44b1055fe","observation_id":"ff1816c0-e15b-4c2c-99e6-b95510212187","resolution":{"observed_at":"2026-08-16T00:17:35.474150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2608.12209","last_updated":"2026-08-12T16:03:31Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T21:40:35.533835Z","submitted_at":"2026-08-12T16:03:31Z","title":"Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":2,"verified_fuzzy":39},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 0 inbound Pith citation observations for arXiv:2608.12209."}