{"as_of":"2026-08-14T01:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:00ca54b333a82f9485302eed3c280e14d6c61976c2ea9051d704a4d7de298daa","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:02:51.437970Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20225/citation-record","integrity":"/paper/2505.20225/integrity","json":"/paper/2505.20225/citation-record.json","paper":"/paper/2505.20225"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.11423","last_updated":"2025-01-29T18:27:16Z","snapshot_observed_at":"2026-08-13T20:58:16.123883Z","submitted_at":"2024-09-12T10:14:12Z","title":"Generated Data with Fake Privacy: Hidden Dangers of Fine-tuning Large Language Models on Generated Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11423","snapshot_observed_at":"2026-08-07T14:02:44.098280Z","title":"Generated data with fake privacy: Hidden dangers of fine-tuning large language models on generated data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.098280Z"},"links":{"cited_paper":"/paper/2409.11423","citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:13446b1f4d961f8d05b1d268ed748f21f58bac83536350f1a9f48eb24d671923","observation_id":"8f7cb68c-c85a-429a-b05b-0f20b46cd02f","resolution":{"observed_at":"2026-08-07T14:02:44.098280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:44.185028Z","title":"Emergent and predictable memorization in large language models.Advances in Neural Information Processing Systems, 36:28072–28090, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.185028Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:cb7d5d370342124b58b9703da437532208f51d0081c95490299194b6d4744701","observation_id":"c9399a12-234f-4d58-953b-785a7351a57b","resolution":{"observed_at":"2026-08-07T14:02:44.185028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:57.241633Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":"40573ded-35db-4872-a7a1-5ff07e20ae17","year":2023},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.270403Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:21d2de33b1d6e5919cc9b308e080c6b5e5d9cd1e9438b8fa476804f7c326f3e2","observation_id":"b1066643-3fa7-4900-bf49-dd1df442b687","resolution":{"observed_at":"2026-08-07T14:02:57.347994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:57.087358Z","title":"PIQA: Reasoning about physical commonsense in natural language","venue":null,"work_id":"d3943071-9343-4007-8546-3b90cba75fae","year":2020},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.386672Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:85a2ad86969ec60d15287f63ae5442fdebae7db32c32330def7d53b17f9548ce","observation_id":"19b5c372-8288-4763-b652-6a08202985e1","resolution":{"observed_at":"2026-08-07T14:02:57.131655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:56.804318Z","title":"On the representation collapse of sparse mixture of experts.Proc","venue":null,"work_id":"32003497-9f73-43cb-b683-655a94ea3b50","year":2022},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.465623Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:666b366c184ec2ebcef84135bced50c4e0bbf75ba71786fed177059f15042a8f","observation_id":"4cc5e103-b3f9-402d-a872-6b5f11822cc6","resolution":{"observed_at":"2026-08-07T14:02:56.991684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:56.612033Z","title":"Think you have solved question answering? Try ARC, the ai2 reasoning challenge.ArXiv preprint, 2018","venue":null,"work_id":"498fba82-3d87-41bc-b5dd-fb01bb5214aa","year":2018},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.535555Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:68718228ccac45c6740d0163246a23cb42716f4d26681468388bd952aaa54be8","observation_id":"17867122-d6c0-4dd7-a013-08ec8d2efbcf","resolution":{"observed_at":"2026-08-07T14:02:56.694982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:44.870448Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.JMLR, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.870448Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:998b03431fc6a5bbabcd8f2769ed19bd344ba24135a4d7cf4837cf2b5c5e4113","observation_id":"979caedc-952a-44ab-8c32-168840215b12","resolution":{"observed_at":"2026-08-07T14:02:44.870448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:46.280209Z","title":"A framework for few-shot language model evaluation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:46.280209Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:ed690b55ae2eb5b2809fbf0c3d3ae0c580573a06ebb8f328bee620e760875a57","observation_id":"ce109ed3-19b0-4f5f-8f44-e4aa15571a9f","resolution":{"observed_at":"2026-08-07T14:02:46.280209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:56.394827Z","title":"Fastmoe: A fast mixture-of-expert training system.ArXiv preprint, 2021","venue":null,"work_id":"40b398fd-9afd-43c2-851a-5e363289819b","year":2021},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:46.500738Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:ae6a5771f23ff3b07250d3695aaf0a6edf590e445ebf64b72388d4cbc4b2cfaa","observation_id":"0260bff8-ab34-40aa-a0e4-839c568c536f","resolution":{"observed_at":"2026-08-07T14:02:56.459809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:56.220245Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":"888774d2-cac0-4e4c-9384-af851cf57273","year":2021},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:47.956423Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:f979c9b676394f34c351ab63392ff80f77d585ab85d9ba8e8be70c873ac321dc","observation_id":"837e542e-4add-4452-860f-13db535962b7","resolution":{"observed_at":"2026-08-07T14:02:56.294055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:56.023680Z","title":"Rae, and Laurent Sifre","venue":null,"work_id":"05e7ad28-cf2e-4ad4-838f-acb9ab974322","year":2022},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.421407Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:db3e29aee92c94188a1faef0db476b768137cdf2d1766f843a7de0eb5d0e4b69","observation_id":"2a02d5d3-a089-44f8-a061-99e75156a5d4","resolution":{"observed_at":"2026-08-07T14:02:56.108386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:55.902183Z","title":"MiniCPM: Unveiling the potential of small language models with scalable training strategies.ArXiv preprint, 2024","venue":null,"work_id":"d000ab04-590b-4dba-801c-d3f020cb5523","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.559340Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:2fdcec7db49f3a56ffbd1e92221246985a80d3a03c99004c76c4a3900bae5370","observation_id":"1ec5f9de-fb94-47fb-8161-ede4a9723c2c","resolution":{"observed_at":"2026-08-07T14:02:55.955220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17817","last_updated":"2024-07-25T07:10:31Z","snapshot_observed_at":"2026-08-13T00:52:52.593110Z","submitted_at":"2024-07-25T07:10:31Z","title":"Demystifying Verbatim Memorization in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17817","snapshot_observed_at":"2026-08-07T14:02:48.631328Z","title":"Demystifying verbatim memorization in large language models.arXiv preprint arXiv:2407.17817, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.631328Z"},"links":{"cited_paper":"/paper/2407.17817","citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:a9ed909656e5d62d76e418d7a212723dfdc0ff3fb84c1f9a963d43cbcf4670be","observation_id":"4d514ff9-0f8f-4d37-909c-3756780d7cc0","resolution":{"observed_at":"2026-08-07T14:02:48.631328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:55.701963Z","title":"Tutel: Adaptive mixture-of-experts at scale.Proc","venue":null,"work_id":"88a350f6-6d2d-42fb-83dd-b2f4a9063128","year":2023},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.696471Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:36a116381dd0699d411cb1c6571f406791e15a0de708cd06a4138ff04a03bef9","observation_id":"9cf0d8ca-ff43-48f7-8858-1af889e32b07","resolution":{"observed_at":"2026-08-07T14:02:55.778999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:55.571510Z","title":"Mixtral of experts.ArXiv preprint, 2024","venue":null,"work_id":"2819a51f-f91e-4d15-8b46-f8bdecd0af09","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.774085Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:de45731ca22c543e107f872460f720160b79266cc3e645af0b38af563a910d43","observation_id":"7836f992-70e3-44e5-96aa-b364a4855eee","resolution":{"observed_at":"2026-08-07T14:02:55.645820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:48.903883Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.903883Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:1905c48a5feb7ed3a59c388d281a66ea24532c11730d848330b52f5c1e634c73","observation_id":"600cf498-58d5-4668-a673-ceed6b75624c","resolution":{"observed_at":"2026-08-07T14:02:48.903883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:55.424491Z","title":"Gshard: Scaling giant models with condi- tional computation and automatic sharding.ArXiv preprint, 2020","venue":null,"work_id":"d694e986-a03f-45d0-bd2f-02753fccf9fb","year":2020},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.998050Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:2b3e90086b9bd95a4e5a73281542f7e83714c86b8e30f89b3a98f231bd701890","observation_id":"91fb215e-94c9-4a4a-ba68-68fac46da7b2","resolution":{"observed_at":"2026-08-07T14:02:55.494798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:55.226141Z","title":"Base layers: Simplifying training of large, sparse models","venue":null,"work_id":"6ca20a19-edd0-453d-be66-4691046dac66","year":2021},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.095709Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:387da798e78923299c3edfec6853d73ae6bb4eba2bbd0200dfa7059efd6fe0f5","observation_id":"57be5bee-4181-4a08-a047-9b862dc2c2d6","resolution":{"observed_at":"2026-08-07T14:02:55.322288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:55.001578Z","title":"DataComp-LM: In search of the next generation of training sets for language models","venue":null,"work_id":"a1874a21-d421-4a24-9704-bd209e497e1a","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.225017Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:fc083022b42f8ba7848b772fdeafa149a9e94d4b5d09f6107927bbdfe79ba71e","observation_id":"32991eed-24c1-4f1d-8a80-38227fbea49e","resolution":{"observed_at":"2026-08-07T14:02:55.097841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:54.813496Z","title":"DeepSeek-V2: A strong, economical, and efficient mixture-of-experts language model.ArXiv preprint, 2024","venue":null,"work_id":"71bca25b-89e1-4e37-87fe-a19caccfcbda","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.299350Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:15a7a542e74577549063bc08771a026e36ed3ee766a38054a1d472092d0db8b7","observation_id":"205aaada-f018-4f97-8661-88b85581ae3c","resolution":{"observed_at":"2026-08-07T14:02:54.915523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:54.619886Z","title":"Deepseek-v3 technical report.ArXiv preprint, 2024","venue":null,"work_id":"49268f7b-eb6d-4841-9463-6012d267e859","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.376132Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:ee56ce3329d2976ffa23d7a458eba66631f7028953b601e67e403c6c3eac7915","observation_id":"2488fdc3-327d-4a77-a490-b7155880a952","resolution":{"observed_at":"2026-08-07T14:02:54.699463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11451","last_updated":"2024-10-15T09:57:19Z","snapshot_observed_at":"2026-08-14T01:13:36.105309Z","submitted_at":"2024-10-15T09:57:19Z","title":"Tending Towards Stability: Convergence Challenges in Small Language Models","version":1},"cited_work":{"arxiv_id":"2410.11451","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11451","snapshot_observed_at":"2026-08-07T14:02:51.859512Z","title":"Tending Towards Stability: Convergence Challenges in Small Language Models","venue":"cs.CL","work_id":"f32fe5d7-6859-465a-acee-1f58f36de26f","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.501554Z"},"links":{"cited_paper":"/paper/2410.11451","citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:c6b5609f1f985d1d690b67542667217376357e208f00497286e84e884d698cf2","observation_id":"c893d78f-3ea9-4cd1-bfd2-30062ab246b4","resolution":{"observed_at":"2026-08-07T14:02:51.956017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:49.622260Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.622260Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:e051463bcd7088bde524941d35ca327250cfacc81e045452626baf11aa73e1dd","observation_id":"347390f4-ba5f-4991-9f2d-07015a526b31","resolution":{"observed_at":"2026-08-07T14:02:49.622260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:54.444758Z","title":"Can a suit of armor conduct electricity? A new dataset for open book question answering","venue":null,"work_id":"c7ad1765-d33b-4cf6-9540-c57c9e225761","year":2018},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.725393Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:a854eb79417341a6333a48b45214366876aa042cb2901ea1d306ff238212208c","observation_id":"377c94ac-495e-4e96-84f2-1f3ca751b85a","resolution":{"observed_at":"2026-08-07T14:02:54.543552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:54.287202Z","title":"OLMoE: Open mixture-of- experts language models","venue":null,"work_id":"b16b1554-910b-4ad0-b422-1730eb625648","year":2025},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.831717Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:78f2501c2694af8ac9ae442acaa9081c86e6d1bd7a29122397074f534e52080c","observation_id":"2e3005a9-6025-4c94-977a-647799d1facc","resolution":{"observed_at":"2026-08-07T14:02:54.352140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:54.118130Z","title":"Attributing mode collapse in the fine-tuning of large language models","venue":null,"work_id":"abc74e5a-2626-460a-a9aa-97141d1f57a2","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.925737Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:daf8e1cfa463a5ded1bd75cde97bd593201336c183f11bf3cdbbe811a3461d17","observation_id":"42cb3bec-3ff6-43e2-9c9d-19449809682d","resolution":{"observed_at":"2026-08-07T14:02:54.222040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:53.957697Z","title":"Deepspeed-moe: Advancing mixture-of- experts inference and training to power next-generation ai scale","venue":null,"work_id":"0689a02d-0098-476a-9f5e-f0d05ea04809","year":2022},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.016518Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:4ac04ad3e63496138a025196eb26a0ea31299bf791988bc380d5d5445d91cecc","observation_id":"59ccef2d-e88b-4f1f-b0ff-247c8dcb8098","resolution":{"observed_at":"2026-08-07T14:02:54.005119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:53.766457Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":"224727b1-e825-4d1b-bf69-8f094ece57f9","year":2020},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.132350Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:4982b2f679823a302edc9819601c4fcb7ddcd5401f16eda1d449d95c59c88b90","observation_id":"9049d2e6-f188-4158-a940-595c4b82c435","resolution":{"observed_at":"2026-08-07T14:02:53.845348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:53.586332Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer.ArXiv preprint, 2017","venue":null,"work_id":"96bf0dfb-54e4-477a-a50b-f208f45859b4","year":2017},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.256613Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:ce746c50879d2f76eb44da3c4a30ef73307f990324242d7c7fd46bdb756efb8f","observation_id":"ee80a897-dbc9-4f7e-8163-6394dfc5ff60","resolution":{"observed_at":"2026-08-07T14:02:53.671642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:53.407221Z","title":"JetMoE: Reaching llama2 performance with 0.1 m dollars.ArXiv preprint, 2024","venue":null,"work_id":"7ad45679-ca9a-4cbb-9108-59e0b15515fb","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.353681Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:9298f3f9b7d902d41259b04dcf57d526d83cd741def02218b4fa28fdd2f3a34f","observation_id":"604aefab-5833-440f-b97d-1813b83ca0a6","resolution":{"observed_at":"2026-08-07T14:02:53.496149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:53.249425Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism.ArXiv preprint, 2019","venue":null,"work_id":"bd344268-15fe-49df-aeac-c778f9f480c3","year":2019},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.455008Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:e0fb0c9f935f88d7968fb3650cc8f0fb2e5049dafab5eb64af0e4387e83b9037","observation_id":"1fc7123e-646d-4393-8b86-6fab5e0cb37f","resolution":{"observed_at":"2026-08-07T14:02:53.348965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02013","last_updated":"2025-06-15T18:27:17Z","snapshot_observed_at":"2026-08-11T13:30:20.350655Z","submitted_at":"2025-02-04T05:03:42Z","title":"Layer by Layer: Uncovering Hidden Representations in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02013","snapshot_observed_at":"2026-08-07T14:02:50.561305Z","title":"Layer by layer: Uncovering hidden representations in language models.arXiv preprint arXiv:2502.02013, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.561305Z"},"links":{"cited_paper":"/paper/2502.02013","citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:fedd76e4bd95ec21de9591bcbecaabc0bd62892c69662f6164f23bd64374720b","observation_id":"3b62554e-adc6-4893-8488-a990ba9a1b9b","resolution":{"observed_at":"2026-08-07T14:02:50.561305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:53.083757Z","title":"Free dolly: Introducing the world’s first truly open instruction-tuned llm","venue":null,"work_id":"631e4d81-cea5-4460-b86c-d1e8de32ee91","year":2023},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.679920Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:f13fd84f1ab2a0966feafd2d8c3848767d78e9b18d7614fa8952047a228716bc","observation_id":"59facc6e-3fac-4b6c-90c8-1093272969e9","resolution":{"observed_at":"2026-08-07T14:02:53.158449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:52.890519Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.ArXiv preprint, 2024","venue":null,"work_id":"b47bdf9f-e52f-4019-9ab7-af93833b5fe0","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.778370Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:a091c61746f1a199611d0fd4bf420cb8088d4fbc2b740bfe03a0c1aaa77da34a","observation_id":"b53b6c84-44e8-4434-9e21-a2ac9b6741f3","resolution":{"observed_at":"2026-08-07T14:02:52.961360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10827","last_updated":"2024-11-25T20:04:58Z","snapshot_observed_at":"2026-08-12T23:21:54.417792Z","submitted_at":"2024-07-15T15:38:51Z","title":"LLM Circuit Analyses Are Consistent Across Training and Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10827","snapshot_observed_at":"2026-08-07T14:02:50.878275Z","title":"Llm circuit analyses are consistent across training and scale.arXiv preprint arXiv:2407.10827, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.878275Z"},"links":{"cited_paper":"/paper/2407.10827","citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:7853686d5465356c309ff085370854b88144269f4f269203f33d9c9ff22976e8","observation_id":"675da49c-9505-4b43-86d1-2942a9db9fec","resolution":{"observed_at":"2026-08-07T14:02:50.878275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:52.687094Z","title":"OpenMoE: An early effort on open mixture-of-experts language models.ArXiv preprint, 2024","venue":null,"work_id":"20374ff6-531e-4e5f-94c5-6654c8895640","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.005458Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:0e18b504380598a9d1a748b115eabef33d378b544c5ba3fc69d6d24075a8a32b","observation_id":"7797fdd4-71a3-47c6-ab3e-5ba497646968","resolution":{"observed_at":"2026-08-07T14:02:52.797912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:52.494417Z","title":"M6-T: Exploring sparse expert models and beyond.arXiv preprint, 2021","venue":null,"work_id":"545d3eaf-72f2-41fd-bd78-b04b9dff3f7a","year":2021},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.127391Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:1e5a3182b0b4baaadca82c5e0d15ff3fde9ffb8f09173324aa61d855fcefe5f8","observation_id":"236e214e-2813-4c4f-a6d9-7e262475f5f7","resolution":{"observed_at":"2026-08-07T14:02:52.594448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:52.331953Z","title":"HellaSwag: Can a machine really finish your sentence? InProc","venue":null,"work_id":"57bed504-b6a1-4b14-8252-523a433d6a37","year":2019},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.236526Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:946ca05184d107f27f384ba45d2208721ebdd059993da1963aaa67dbdc17fd6e","observation_id":"8fb563fd-cd57-47fa-8787-b1992250163a","resolution":{"observed_at":"2026-08-07T14:02:52.401440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:52.108050Z","title":"OPT: Open pre-trained transformer language models.ArXiv preprint, 2022","venue":null,"work_id":"b186d629-91cb-4a30-841c-0e27a5cfc53c","year":2022},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.365700Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:f9b0f34eaa438b6d54f1842797a35a49b4bf8b40eb06aebb835f12a4f303ed2f","observation_id":"7475c41a-9ede-430d-bf65-5afe0a0e104e","resolution":{"observed_at":"2026-08-07T14:02:52.220119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9017.37247","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:51.654044Z","title":"ST-MoE: Designing stable and transferable sparse expert models.ArXiv preprint, 2022","venue":null,"work_id":"7a9f60c3-fc4a-4dd0-96f1-d3c82761eff0","year":2022},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.437970Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:749de48430a2f33255cbc9d794caaf16d4a65a7c5f358f058b371be1506e77c4","observation_id":"846f8683-413e-4ca0-842b-a049c33d399f","resolution":{"observed_at":"2026-08-07T14:02:51.728312Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2505.20225."}