{"as_of":"2026-08-09T17:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9a69cc59f9c2865e7e55046e40f93597eea7f561181005aee338a7a26d35bdf7","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:15:30.256170Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.06137/citation-record","integrity":"/paper/2507.06137/integrity","json":"/paper/2507.06137/citation-record.json","paper":"/paper/2507.06137"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.07112","last_updated":"2024-12-10T01:57:17Z","snapshot_observed_at":"2026-07-06T20:04:20.826875Z","submitted_at":"2024-12-10T01:57:17Z","title":"Maya: An Instruction Finetuned Multilingual Multimodal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.07112","snapshot_observed_at":"2026-08-06T19:15:25.391619Z","title":"Maya: 25 An instruction finetuned multilingual multimodal model.arXiv preprint arXiv:2412.07112,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:25.391619Z"},"links":{"cited_paper":"/paper/2412.07112","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:5700305464243c892ce4edd0072ed6ea15584c9c95f0f09c65b7f3f17c012c77","observation_id":"cb33f64b-e506-4043-9aba-00eb31d940d3","resolution":{"observed_at":"2026-08-06T19:15:25.391619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T19:15:25.702878Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:25.702878Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:474bf5a38f839972392262584c4d69ed0db5beca7628a51af4681690fb439062","observation_id":"631a2c31-c178-42c3-bb22-427e5ee31236","resolution":{"observed_at":"2026-08-06T19:15:25.702878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11832","last_updated":"2024-10-29T06:44:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:44Z","title":"Unveiling Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11832","snapshot_observed_at":"2026-08-06T19:15:26.468458Z","title":"Unveiling encoder-free vision-language models.arXiv preprint arXiv:2406.11832,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:26.468458Z"},"links":{"cited_paper":"/paper/2406.11832","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:238fda240a76bb18cf147bf8a6d66b9f68b0ea183d45d6dd77ab935abb7021c5","observation_id":"9946d252-2a16-4bd1-a9e0-50e93c74d681","resolution":{"observed_at":"2026-08-06T19:15:26.468458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06788","snapshot_observed_at":"2026-08-06T19:15:26.683136Z","title":"Evev2: Improved baselines for encoder-free vision-language models.arXiv preprint arXiv:2502.06788,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:26.683136Z"},"links":{"cited_paper":"/paper/2502.06788","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:d7dc7f90c65cc074ecdc86d1b8fdc979579f7f5145856b256b75130a0704daf8","observation_id":"b134bd5a-39fd-43cc-9b02-961aba8666fb","resolution":{"observed_at":"2026-08-06T19:15:26.683136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13436","last_updated":"2025-03-17T17:58:30Z","snapshot_observed_at":"2026-08-07T16:57:02.267787Z","submitted_at":"2025-03-17T17:58:30Z","title":"Unified Autoregressive Visual Generation and Understanding with Continuous Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13436","snapshot_observed_at":"2026-08-06T19:15:26.807532Z","title":"Unified autoregressive visual generation and understanding with continuous tokens.arXiv preprint arXiv:2503.13436,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:26.807532Z"},"links":{"cited_paper":"/paper/2503.13436","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:dffcf2de2d91cf0a205c207333b69ae3c164c808adf111c7d47beeed49e3df63","observation_id":"254445f6-6f51-42b2-a357-beb673a5d945","resolution":{"observed_at":"2026-08-06T19:15:26.807532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16092","last_updated":"2025-06-02T15:04:03Z","snapshot_observed_at":"2026-07-06T17:21:46.980522Z","submitted_at":"2024-01-29T12:02:28Z","title":"Multilingual Text-to-Image Generation Magnifies Gender Stereotypes and Prompt Engineering May Not Help You","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16092","snapshot_observed_at":"2026-08-06T19:15:26.989066Z","title":"Multilingual text-to-image generation magnifies gender stereotypes and prompt engineering may not help you.arXiv preprint arXiv:2401.16092,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:26.989066Z"},"links":{"cited_paper":"/paper/2401.16092","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:fc3b5749e072f9fce503ddba25a904b5018078fb48b5954f4cadc486ab394faf","observation_id":"d72cfab3-18e6-48e9-91b5-a235dabc64fd","resolution":{"observed_at":"2026-08-06T19:15:26.989066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14396","last_updated":"2025-03-02T07:53:44Z","snapshot_observed_at":"2026-07-06T18:03:51.687441Z","submitted_at":"2024-04-22T17:56:09Z","title":"SEED-X: Multimodal Models with Unified Multi-granularity Comprehension and Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14396","snapshot_observed_at":"2026-08-06T19:15:27.073467Z","title":"Seed-x: Multimodal models with unified multi-granularity comprehension and generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:27.073467Z"},"links":{"cited_paper":"/paper/2404.14396","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:d7db9535b7ffb3ba3288a6a169233d6b3de99abf237fed1bc82635430d4bbe30","observation_id":"30340b37-b221-4601-8d44-65aa3e124624","resolution":{"observed_at":"2026-08-06T19:15:27.073467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-06T19:15:27.198563Z","title":"Gemma 2: Improving open language models at a practical size.arXiv preprint arXiv:2408.00118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:27.198563Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:e498adc06da95b942763b733f1bb0431ba2217e936ed15ebd574e5dc3754ef02","observation_id":"d2d36bcb-25a6-48a7-9c07-3895644aefac","resolution":{"observed_at":"2026-08-06T19:15:27.198563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04245","last_updated":"2020-10-08T20:12:35Z","snapshot_observed_at":"2026-08-09T01:45:23.290455Z","submitted_at":"2020-10-08T20:12:35Z","title":"Query-Key Normalization for Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04245","snapshot_observed_at":"2026-08-06T19:15:27.347457Z","title":"Query-key normalization for transformers.arXiv preprint arXiv:2010.04245,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:27.347457Z"},"links":{"cited_paper":"/paper/2010.04245","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:86e07b27b2a5459e6d9c2d01c504d184af01a7b80ab49c50adb70304d222f819","observation_id":"31ce32f2-439b-4933-86bf-cfb3c1f8858f","resolution":{"observed_at":"2026-08-06T19:15:27.347457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-06T19:15:27.441402Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:27.441402Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:c9830d986e78538709cb18f7be7c513f22e18f5c786aae98a89e9650a855559a","observation_id":"4f5c16ae-896a-4719-b33c-75995bd231c8","resolution":{"observed_at":"2026-08-06T19:15:27.441402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-09T16:24:26.560430Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05135","snapshot_observed_at":"2026-08-06T19:15:27.601678Z","title":"Ella: Equip diffusion models with llm for enhanced semantic alignment.arXiv preprint arXiv:2403.05135,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:27.601678Z"},"links":{"cited_paper":"/paper/2403.05135","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:b6f27a8255b025303d56b01b3d39080edc13c88151d856d6ace89421c4f70f2d","observation_id":"c15b6851-c074-4f8b-a2f5-436b3e2d4194","resolution":{"observed_at":"2026-08-06T19:15:27.601678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16777","last_updated":"2024-03-25T13:53:04Z","snapshot_observed_at":"2026-07-06T17:50:09.945123Z","submitted_at":"2024-03-25T13:53:04Z","title":"Can Machine Translation Bridge Multilingual Pretraining and Cross-lingual Transfer Learning?","version":1},"cited_work":{"arxiv_id":"2403.16777","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.16777","snapshot_observed_at":"2026-08-06T19:15:31.074335Z","title":"Can Machine Translation Bridge Multilingual Pretraining and Cross-lingual Transfer Learning?","venue":"cs.CL","work_id":"5c7f4894-dbf1-42f0-9622-5d5bb4b96774","year":2024},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:27.773933Z"},"links":{"cited_paper":"/paper/2403.16777","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:2ea8eb8fcb085132ceffc98a524997ff2e114ab803458df870fb26923055ffb7","observation_id":"d218fce7-2b80-471a-a9a3-58b2ca2c4d28","resolution":{"observed_at":"2026-08-06T19:15:31.199854Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04423","last_updated":"2025-04-06T09:20:49Z","snapshot_observed_at":"2026-08-07T16:08:15.150652Z","submitted_at":"2025-04-06T09:20:49Z","title":"UniToken: Harmonizing Multimodal Understanding and Generation through Unified Visual Encoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04423","snapshot_observed_at":"2026-08-06T19:15:27.932896Z","title":"Uni- token: Harmonizing multimodal understanding and generation through unified visual encoding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:27.932896Z"},"links":{"cited_paper":"/paper/2504.04423","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:ab267fd72a8275a18343b0c3775bcec6128632bf62cee7d506dcca470ada727e","observation_id":"1b1501ce-e4d0-4e53-970f-12d20944505e","resolution":{"observed_at":"2026-08-06T19:15:27.932896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03651","last_updated":"2016-12-12T12:51:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-12-12T12:51:03Z","title":"FastText.zip: Compressing text classification models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03651","snapshot_observed_at":"2026-08-06T19:15:28.033284Z","title":"Fasttext.zip: Compressing text classification models.arXiv preprint arXiv:1612.03651,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.033284Z"},"links":{"cited_paper":"/paper/1612.03651","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:1aca4041b9708da20cd226210db2a845ec16d9d210f1addd8d8f68647b9d7e6d","observation_id":"6b08cd28-f79d-4bcf-a796-148f67398d29","resolution":{"observed_at":"2026-08-06T19:15:28.033284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14125","last_updated":"2024-06-04T17:25:20Z","snapshot_observed_at":"2026-07-30T23:45:07.963944Z","submitted_at":"2023-12-21T18:46:41Z","title":"VideoPoet: A Large Language Model for Zero-Shot Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14125","snapshot_observed_at":"2026-08-06T19:15:28.124600Z","title":"Videopoet: A large language model for zero-shot video generation.arXiv preprint arXiv:2312.14125,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.124600Z"},"links":{"cited_paper":"/paper/2312.14125","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:db6d8a1000751d04d82aa7c5702ddca319ae53185ea0ea3a5063889421cfd48e","observation_id":"3fe09f47-9a25-4651-a236-9982132ba8f6","resolution":{"observed_at":"2026-08-06T19:15:28.124600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T19:15:28.211962Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.211962Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:f2787243ca6c506b23c9020be34f3ea9f4eed583e7c57cfa3141cecd6773a94f","observation_id":"b8005ad2-6a13-410c-84b9-50cc38d8ebab","resolution":{"observed_at":"2026-08-06T19:15:28.211962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08268","last_updated":"2025-02-03T21:47:31Z","snapshot_observed_at":"2026-08-05T16:01:06.026395Z","submitted_at":"2024-02-13T07:47:36Z","title":"World Model on Million-Length Video And Language With Blockwise RingAttention","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08268","snapshot_observed_at":"2026-08-06T19:15:28.270949Z","title":"World model on million-length video and language with blockwise ringattention.arXiv preprint arXiv:2402.08268, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.270949Z"},"links":{"cited_paper":"/paper/2402.08268","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:5c1c31c8f6370b415d5d774f0ec322218355801421459bc3162e4270dc1df030","observation_id":"25c1158c-f34c-409b-92e5-072b748233c3","resolution":{"observed_at":"2026-08-06T19:15:28.270949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:28.353210Z","title":"Unitok: A unified tokenizer for visual generation and understanding.arXiv preprint arXiv:2502.20321,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.353210Z"},"links":{"citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:8297a05a4018b8aaa932a7aabe9c61400f9b21e55ed4be9748ed84e999f65273","observation_id":"a9136bbe-be09-4210-b494-91e210e38659","resolution":{"observed_at":"2026-08-06T19:15:28.353210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-06T19:15:28.431651Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.431651Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:0307afdc4bab61c4457b4c3ea9c007e542cb708cb34e2e7aea83d8c201b68e58","observation_id":"ecf123eb-7021-4755-aed5-e17f9c720df3","resolution":{"observed_at":"2026-08-06T19:15:28.431651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.06256","last_updated":"2025-04-08T17:58:47Z","snapshot_observed_at":"2026-08-03T00:43:33.310493Z","submitted_at":"2025-04-08T17:58:47Z","title":"Transfer between Modalities with MetaQueries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.06256","snapshot_observed_at":"2026-08-06T19:15:28.550123Z","title":"Transfer between modalities with metaqueries.arXiv preprint arXiv:2504.06256,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.550123Z"},"links":{"cited_paper":"/paper/2504.06256","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:1be58464a9ab6ab9d2726a6d1bd90674e703e31edae34e0cae371bb14ccf33a3","observation_id":"e539eae7-006a-408a-b50f-4dc91a831b44","resolution":{"observed_at":"2026-08-06T19:15:28.550123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01827","last_updated":"2025-07-08T00:51:16Z","snapshot_observed_at":"2026-08-04T04:01:49.750596Z","submitted_at":"2024-12-02T18:59:53Z","title":"RandAR: Decoder-only Autoregressive Visual Generation in Random Orders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01827","snapshot_observed_at":"2026-08-06T19:15:28.641209Z","title":"Freeman, and Yu-Xiong Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.641209Z"},"links":{"cited_paper":"/paper/2412.01827","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:e4cf7b6e2109e987c582a0d784141556e19687aa07f8a06e9ad334c0ce09c9af","observation_id":"84849d24-f5bc-423b-8b0c-b90328786bee","resolution":{"observed_at":"2026-08-06T19:15:28.641209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-08-06T19:15:28.700319Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis.arXiv preprint arXiv:2307.01952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.700319Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:c066440c670161fbac7451f003b37fbe5629db9dbcec2a3671e7088f891828a4","observation_id":"87a9d507-2af6-4aa2-8ef5-fccc3ff0a297","resolution":{"observed_at":"2026-08-06T19:15:28.700319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21758","last_updated":"2025-03-27T17:57:07Z","snapshot_observed_at":"2026-08-07T16:59:27.482089Z","submitted_at":"2025-03-27T17:57:07Z","title":"Lumina-Image 2.0: A Unified and Efficient Image Generative Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21758","snapshot_observed_at":"2026-08-06T19:15:28.767123Z","title":"Lumina-image 2.0: A unified and efficient image generative framework.arXiv preprint arXiv:2503.21758,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.767123Z"},"links":{"cited_paper":"/paper/2503.21758","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:0a516ab605518f8263470617673fa972625f75d721ec3b8b9097c92008cd508b","observation_id":"ef5c483c-58d7-44d2-a74d-067543e4b338","resolution":{"observed_at":"2026-08-06T19:15:28.767123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T19:15:28.869995Z","title":"Hierarchical text- conditional image generation with clip latents.arXiv preprint arXiv:2204.06125,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.869995Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:39d77fce6e5a41e4f65dc674a1131fc5c186f8aeb734fb9e9d2beb227965c331","observation_id":"f6e251c7-9a5f-43f2-861a-702c69504870","resolution":{"observed_at":"2026-08-06T19:15:28.869995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07072","last_updated":"2025-04-29T07:52:17Z","snapshot_observed_at":"2026-08-07T16:07:07.289179Z","submitted_at":"2025-04-09T17:43:16Z","title":"Kaleidoscope: In-language Exams for Massively Multilingual Vision Evaluation","version":2},"cited_work":{"arxiv_id":"2504.07072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.07072","snapshot_observed_at":"2026-08-06T19:15:30.719597Z","title":"Kaleidoscope: In-language Exams for Massively Multilingual Vision Evaluation","venue":"cs.CL","work_id":"71aa3c46-6c6b-4a38-895b-f628f117220a","year":2025},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:28.957234Z"},"links":{"cited_paper":"/paper/2504.07072","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:a993aa5c128caec563b4060dde738d577e736f1bd88b92feb416b3f2a370d512","observation_id":"c4138b83-579b-4ade-b54e-9356f01811d9","resolution":{"observed_at":"2026-08-06T19:15:30.797941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08685","last_updated":"2025-05-05T03:31:30Z","snapshot_observed_at":"2026-08-09T05:24:50.195241Z","submitted_at":"2025-04-11T16:46:20Z","title":"Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08685","snapshot_observed_at":"2026-08-06T19:15:29.024903Z","title":"Seaweed-7b: Cost-effective training of video generation foundation model.arXiv preprint arXiv:2504.08685,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.024903Z"},"links":{"cited_paper":"/paper/2504.08685","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:373eb34549361482e960151fb20b5aabf5a1d9eba256f1ef59d377944adbafd0","observation_id":"8a5f9eb3-2c81-4037-8a93-fffaf842bcaa","resolution":{"observed_at":"2026-08-06T19:15:29.024903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16677","last_updated":"2025-04-23T12:52:49Z","snapshot_observed_at":"2026-08-07T15:59:54.798744Z","submitted_at":"2025-04-23T12:52:49Z","title":"A Post-trainer's Guide to Multilingual Training Data: Uncovering Cross-lingual Transfer Dynamics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16677","snapshot_observed_at":"2026-08-06T19:15:29.104588Z","title":"A post-trainer’s guide to multilingual training data: Uncovering cross-lingual transfer dynamics.arXiv preprint arXiv:2504.16677,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.104588Z"},"links":{"cited_paper":"/paper/2504.16677","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:fd7dcb7e17b021f062e0ee65b57e075286c2419bb68f65f8dd15f4eaf97f4643","observation_id":"d4245c9d-9cff-43e8-a9f2-9c0a2cb82fd8","resolution":{"observed_at":"2026-08-06T19:15:29.104588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03304","last_updated":"2025-02-19T13:30:23Z","snapshot_observed_at":"2026-08-09T14:26:53.957065Z","submitted_at":"2024-12-04T13:27:09Z","title":"Global MMLU: Understanding and Addressing Cultural and Linguistic Biases in Multilingual Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03304","snapshot_observed_at":"2026-08-06T19:15:29.193312Z","title":"Global mmlu: Understanding and addressing cultural and linguistic biases in multilingual evalu- ation.arXiv preprint arXiv:2412.03304,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.193312Z"},"links":{"cited_paper":"/paper/2412.03304","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:c382cb8999a27760dc57308bed758e535d758aab6fcf69adafa0c218623725cd","observation_id":"750250b7-ee98-4417-a503-cce1a9612577","resolution":{"observed_at":"2026-08-06T19:15:29.193312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14324","last_updated":"2026-04-20T17:55:12Z","snapshot_observed_at":"2026-08-02T12:34:37.994590Z","submitted_at":"2025-03-18T14:56:46Z","title":"DualToken: Towards Unifying Visual Understanding and Generation with Dual Visual Vocabularies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14324","snapshot_observed_at":"2026-08-06T19:15:29.272159Z","title":"Dualtoken: Towards unifying visual understanding and generation with dual visual vocabularies.arXiv preprint arXiv:2503.14324,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.272159Z"},"links":{"cited_paper":"/paper/2503.14324","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:832234ea6bcf203cdfb907f3eb0133c906fe61a0e4e39d986a4c80037a1d18b2","observation_id":"5ef95c25-ff74-4ac7-9f6d-d791075b3e6f","resolution":{"observed_at":"2026-08-06T19:15:29.272159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-06T19:15:29.335024Z","title":"Journeydb: A benchmark for generative image understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.335024Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:ae5a3190597a45681e0b3f3a90e122189f6544add2fde60529494f9f65229850","observation_id":"c52fc6c6-c3b3-4d9a-9b8a-4a1a76eff23b","resolution":{"observed_at":"2026-08-06T19:15:29.335024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T19:15:29.406317Z","title":"Eva-clip: Improved training techniques for clip at scale.arXiv preprint arXiv:2303.15389, 2023b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.406317Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:403d6092daafb359200892182197d04b297df12bd52528470f4940795f5c50e9","observation_id":"0ccf7602-5185-4563-bf83-13478538a945","resolution":{"observed_at":"2026-08-06T19:15:29.406317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-06T19:15:29.476204Z","title":"Chameleon: Mixed-modal early-fusion foundation models.arXiv preprint arXiv:2405.09818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.476204Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:14d351ca0ae3b5746692d756a6088d879fbffcba1810f46049bda0c40844184f","observation_id":"84989b3e-ab84-48c4-b495-ada5ae199b79","resolution":{"observed_at":"2026-08-06T19:15:29.476204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-08-06T19:15:29.556430Z","title":"Metamorph: Multimodal understanding and generation via instruction tuning.arXiv preprint arXiv:2412.14164,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.556430Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:0a6b8bb5f8756f5e6d39175d14900decd44f6b2e4f7727eecbdbbf8527dbc084","observation_id":"bcb76d96-db31-412a-9d90-ada7b793bf4f","resolution":{"observed_at":"2026-08-06T19:15:29.556430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-08-06T19:15:29.647335Z","title":"Emu3: Next-token prediction is all you need","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.647335Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:692b856391866608d9938fe98ba73c35fce738907b96f408538e83e5ba2eff66","observation_id":"823772c9-11de-4d68-86e5-bef1879fb05d","resolution":{"observed_at":"2026-08-06T19:15:29.647335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11501","last_updated":"2024-01-29T23:09:49Z","snapshot_observed_at":"2026-08-07T13:03:59.832548Z","submitted_at":"2023-04-23T00:04:14Z","title":"Lost in Translationese? Reducing Translation Effect Using Abstract Meaning Representation","version":2},"cited_work":{"arxiv_id":"2304.11501","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.11501","snapshot_observed_at":"2026-08-06T19:15:30.439579Z","title":"Lost in Translationese? Reducing Translation Effect Using Abstract Meaning Representation","venue":"cs.CL","work_id":"547233b3-3d2e-456b-9c6b-833f6828b656","year":2023},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.734374Z"},"links":{"cited_paper":"/paper/2304.11501","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:8c4be25e9e26d16933b910d8c403bee2eae4c83ad9d9b2b05cb77c5ff70ee77c","observation_id":"b6d61fb3-5fe1-4f19-beca-242e2c1675b5","resolution":{"observed_at":"2026-08-06T19:15:30.527154Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-04T16:34:07.714734Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-06T19:15:29.821240Z","title":"Tune-a-video: One-shot tuning of image diffusion 31 models for text-to-video generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.821240Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:cdf1f6a7e8dc69f9c9bff6194db23b69be0ef7cfae42483ca52496c032fa690d","observation_id":"9950c082-bd59-48a2-b4f5-f46c7fa7a7a6","resolution":{"observed_at":"2026-08-06T19:15:29.821240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18427","last_updated":"2025-05-17T13:26:31Z","snapshot_observed_at":"2026-08-06T13:34:35.279373Z","submitted_at":"2025-01-30T15:31:48Z","title":"SANA 1.5: Efficient Scaling of Training-Time and Inference-Time Compute in Linear Diffusion Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18427","snapshot_observed_at":"2026-08-06T19:15:29.901066Z","title":"Sana 1.5: Efficient scaling of training-time and inference- time compute in linear diffusion transformer.arXiv preprint arXiv:2501.18427, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.901066Z"},"links":{"cited_paper":"/paper/2501.18427","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:ef80c21ac7515d5450d5fc8b55e15f32ee8346690b66321e51a56b4996ec46be","observation_id":"1d9384ee-5dea-4cc9-9f23-c46383ba6e3c","resolution":{"observed_at":"2026-08-06T19:15:29.901066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T19:15:29.991196Z","title":"Show-o: One single trans- former to unify multimodal understanding and generation.International Conference on Learning Representations, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:29.991196Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:11982c38cd732827cf0bfa4fd13101f7428675accac9501bd23053649beec14c","observation_id":"a32ea1f1-dd39-4029-90ad-51333bebfebb","resolution":{"observed_at":"2026-08-06T19:15:29.991196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-06T19:15:30.054891Z","title":"Language model beats diffusion– tokenizer is key to visual generation.arXiv preprint arXiv:2310.05737,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:30.054891Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:00d67e01fc416d70d110cfff7cc79083d8579fc0105ffb9c03675038a91f7d0e","observation_id":"d24a4c6c-7837-4d13-84c2-e59c8f7621c1","resolution":{"observed_at":"2026-08-06T19:15:30.054891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15818","last_updated":"2025-05-30T03:55:20Z","snapshot_observed_at":"2026-08-05T00:59:34.191472Z","submitted_at":"2023-09-27T17:44:18Z","title":"Show-1: Marrying Pixel and Latent Diffusion Models for Text-to-Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15818","snapshot_observed_at":"2026-08-06T19:15:30.153376Z","title":"Show-1: Marrying pixel and latent diffusion models for text-to-video generation.arXiv preprint arXiv:2309.15818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:30.153376Z"},"links":{"cited_paper":"/paper/2309.15818","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:ea8ee5b83721858e092869c9c45e7bb5ea76c28e682404c83547a4396b3e74f4","observation_id":"edc4c914-eb9e-4cdc-a452-ca4cdb0daf9f","resolution":{"observed_at":"2026-08-06T19:15:30.153376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:31.693885Z","title":"Table 7 outlines the key hyperparameters used across the three pretraining stages and two instruction tuning stages ofNeoBabel","venue":null,"work_id":"89b6938e-eec3-4691-bd4a-befe6ed74752","year":2000},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:30.256170Z"},"links":{"citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:ed2193b5a74de72fb2948df97b05f2889bca38a252a6f76b79515bb7b2c46119","observation_id":"19bb7719-1b68-4860-ba77-6496cb8cccf0","resolution":{"observed_at":"2026-08-06T19:15:31.763902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-06T19:15:26.147148Z","title":"No language left behind: Scaling human-centered machine translation.arXiv preprint arXiv:2207.04672,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:26.147148Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:644d8028acdb08837a7be9e0f2b8e7b8ac526b59e5ed1aee6f2d4690c2dc8b89","observation_id":"fa08158c-384b-4894-a205-04d72179bc66","resolution":{"observed_at":"2026-08-06T19:15:26.147148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-06T19:15:26.005732Z","title":"Janus-pro: Unified multimodal understanding and generation with data and model scaling.arXiv preprint arXiv:2501.17811, 2025b","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:26.005732Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:4ecffaac152e9822e36c5a40c3f28b80bc6bcb4186974210c26a0707e97b74cd","observation_id":"434fee0b-cea0-43fa-991e-e6853c4146ec","resolution":{"observed_at":"2026-08-06T19:15:26.005732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-08-06T19:15:25.901325Z","title":"Blip3-o: A family of fully open unified multimodal models-architecture, training and dataset.arXiv preprint arXiv:2505.09568, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:25.901325Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:683747cf740c1c23b56433492f315a5ac54f5c2d49a914171301132bde9046ab","observation_id":"0e4f07a4-8b8b-48ae-b291-2ac684ddf55b","resolution":{"observed_at":"2026-08-06T19:15:25.901325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08751","last_updated":"2025-05-13T17:03:48Z","snapshot_observed_at":"2026-08-08T14:41:38.021739Z","submitted_at":"2025-05-13T17:03:48Z","title":"Aya Vision: Advancing the Frontier of Multilingual Multimodality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08751","snapshot_observed_at":"2026-08-06T19:15:26.315533Z","title":"Aya vision: Advancing the frontier of multilingual multimodality.arXiv preprint arXiv:2505.08751,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:26.315533Z"},"links":{"cited_paper":"/paper/2505.08751","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:5e610f7e9d3bf6ef6853208cca0f149034cfd25f1e16cf42268061276b2237dd","observation_id":"c37b8bb7-1171-42e1-97a6-dfa957596b5c","resolution":{"observed_at":"2026-08-06T19:15:26.315533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12158","last_updated":"2025-05-23T14:59:46Z","snapshot_observed_at":"2026-08-09T00:30:28.302172Z","submitted_at":"2025-05-17T22:35:40Z","title":"The AI Gap: How Socioeconomic Status Affects Language Technology Interactions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12158","snapshot_observed_at":"2026-08-06T19:15:25.790040Z","title":"The ai gap: How socioeconomic status affects language technology interactions.arXiv preprint arXiv:2505.12158,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:25.790040Z"},"links":{"cited_paper":"/paper/2505.12158","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:3e7932205e7c085606b2d77f513f29c249dff6051327b2fde8b9cdddf0647b3b","observation_id":"47cea15a-199a-409b-b992-c139363e0bdf","resolution":{"observed_at":"2026-08-06T19:15:25.790040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08910","last_updated":"2025-05-15T04:24:06Z","snapshot_observed_at":"2026-08-07T15:45:38.294747Z","submitted_at":"2025-05-13T19:01:12Z","title":"Behind Maya: Building a Multilingual Vision Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08910","snapshot_observed_at":"2026-08-06T19:15:25.470790Z","title":"Behind maya: Building a multilingual vision language model.arXiv preprint arXiv:2505.08910,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:25.470790Z"},"links":{"cited_paper":"/paper/2505.08910","citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:514e0148d543b795b568a4d60110d3a0b11d75445ecb4d3adbb9ae666013412f","observation_id":"6843ef6c-36d7-4520-9596-96ea59f178fc","resolution":{"observed_at":"2026-08-06T19:15:25.470790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.22724","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:15:31.470456Z","title":"The translation barrier hypothesis: Multilingual generation with large language models suffers from implicit translation failure.arXiv preprint arXiv:2506.22724,","venue":null,"work_id":"7cfe4327-2968-45ec-a072-c14395a9ac22","year":null},"citing_paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T19:15:25.568660Z"},"links":{"citing_paper":"/paper/2507.06137"},"observation_digest":"sha256:d3cbdcfb402149116c5acb940a31a98058052877c80a0e5911d25f50dbba68e5","observation_id":"f2b6346c-e4f2-4a19-a54a-ad7d8a06a3b4","resolution":{"observed_at":"2026-08-06T19:15:31.575544Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.06137","last_updated":"2025-07-08T16:19:45Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T22:26:24.906449Z","submitted_at":"2025-07-08T16:19:45Z","title":"NeoBabel: A Multilingual Open Tower for Visual Generation"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":4,"verified_fuzzy":1},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2507.06137."}